Автоматизирую разбор неструктурированных и «грязных» Excel-файлов: извлечение сущностей, нормализация полей, обогащение справочниками и выгрузка в CRM или ERP. LLM понимает контекст ячеек там, где классический парсер ломается на merged cells и произвольных заголовках.
С чем обычно приходят
Типичные ситуации, когда стандартные решения уже не справляются.
- Партнёры и поставщики присылают прайсы в разных форматах Excel — аналитик тратит 2–3 дня в неделю на ручную сводку.
- Менеджеры загружают лиды из таблиц в CRM вручную: опечатки в телефонах, дубли, потерянные строки.
- Бухгалтерия получает акты сверки в Excel с нестандартной вёрсткой — OCR и regex не справляются.
- Нужно мигрировать 50 000 строк из legacy-таблиц, но структура колонок менялась три раза за пять лет.
Как я работаю
Пошаговый процесс — от диагностики до передачи в эксплуатацию.
- 01
Аудит образцов и целевой схемы
Собираю репрезентативные файлы от всех источников, описываю целевую структуру в CRM/ERP. Фиксирую правила валидации, дедупликации и обогащения.
- 02
Проектирование пайплайна
Выбираю связку LLM + детерминированных правил: что извлекает модель, что проверяет код. Проектирую очередь обработки, лог ошибок и ручной review для спорных строк.
- 03
Разработка и тестирование
Пишу пайплайн ingestion, промпты для извлечения, маппинг в целевую схему. Прогоняю на исторических файлах, считаю точность и процент строк на ручную проверку.
- 04
Запуск и передача
Подключаю к n8n или cron для регулярной обработки, настраиваю алерты при аномалиях. Передаю инструкцию и дашборд качества данных.
Что вы получаете
- Время обработки измеряется на пилоте; целевой benchmark фиксируется для типовых файлов
- Успешно обработанные строки приводятся к целевой CRM-схеме, спорные уходят на review
- Снижение ошибок ручного ввода и дублей при загрузке
- Прозрачный контроль качества: сколько строк прошло автоматически, сколько на review
Что входит в проект
- Пайплайн автоматической обработки Excel с LLM-извлечением
- Маппинг полей в целевую CRM/ERP-схему
- Дашборд качества: точность, дубли, строки на review
- Интеграция с n8n, API или SFTP для регулярных загрузок
- Лог ошибок и механизм ручной коррекции спорных записей
- Документация по добавлению новых форматов файлов
Почему мне доверяют такие задачи
Михаил Клименко автоматизировал загрузку и нормализацию данных в коммерческих CRM — ESM-CRM и Lidora-CRM работали с «грязными» входящими потоками лидов и прайсов. AI-извлечение из Excel встраиваю в n8n-сценарии и CRM-контур, чтобы результат сразу попадал в операционку, а не в отдельную таблицу.
Частые вопросы
LLM или классический парсер — когда что?
Детерминированный парсер — для стабильных форматов, LLM — где заголовки, merged cells и структура плавают. Обычно комбинирую: LLM извлекает структуру, код валидирует и нормализует.
Как контролировать качество извлечения?
Строю eval на исторических файлах с эталонной разметкой. В продакшене — sampling на review, алерты при падении confidence и дашборд метрик по каждому источнику.
Можно ли обрабатывать файлы локально?
Да. Для чувствительных данных — локальный Ollama или on-premise inference. Пайплайн один и тот же, меняется только endpoint модели.
Сколько стоит обработка одного файла?
Зависит от размера и сложности. На пилоте считаю стоимость inference на ваших типовых файлах и сравниваю с текущими трудозатратами аналитика.
