Интеграции

Распознавание документов нейросетью в своей CRM: без ручного ввода и без рисков по 152-ФЗ

17 сентября 2026 г. · 6 мин чтения

Распознавание документов нейросетью в своей CRM: без ручного ввода и без рисков по 152-ФЗ

Сканы и фотографии документов — это ручной труд: менеджер открывает скан, читает реквизиты и вбивает их в поля карточки. На десятках документов в день это часы работы и неизбежные опечатки. Распознавание нейросетью убирает этот этап: система сама достаёт данные из документа и предлагает заполнить ими поля. Ниже — как это устроено, как встроить распознавание в свою CRM или учётную систему и что важно не забыть, если в документах есть персональные данные.

Что вообще можно распознать

Нейросети хорошо справляются с документами, где данные лежат в предсказуемых местах:

  • Реквизиты и поля — наименования, номера, даты, суммы, адреса.
  • Бланки, договоры, счета, накладные — типовые формы с постоянной структурой.
  • Табличные данные — позиции, количества, цены, итоги.
  • Многостраничные PDF — каждая страница распознаётся как отдельный снимок, поэтому подходит и лицевая, и оборотная сторона.

Качественные оценки и решения, которые требуют профессионального суждения, остаются за человеком. Нейросеть снимает рутину, но не заменяет специалиста.

Два разных типа задач

Важно не путать две технологии, потому что у них разная цена и разные требования к данным.

Оптическое распознавание (OCR, vision-модели). Превращает изображение в текст и находит на нём реквизиты. Работает с самим документом, поэтому именно на этом этапе в обработку попадают персональные данные.

Языковая модель (LLM). Разбирает уже извлечённый текст: приводит поля к единому виду, сопоставляет со справочником, проверяет логику, а в некоторых задачах — анализирует структуру документа целиком и расставляет в нём переменные для автозаполнения.

Разделение важно ещё и потому, что OCR можно выполнить полностью в российском контуре за копейки, а языковую модель выбрать отдельно — отечественную или импортную, с маскированием данных.

Как встроить это в свою систему

Распознавание не должно быть отдельным сервисом «в соседней вкладке». Оно работает, когда встроено прямо в рабочий процесс:

  1. Кнопка в карточке. В приложении или вложении документа — кнопка «Распознать». Не нужно скачивать файл, куда-то загружать и возвращать результат вручную.
  2. Фоновая обработка. Распознавание идёт в очереди, окно можно закрыть — результат сохранится. Как только готов первый файл, его поля уже доступны, не нужно ждать остальные.
  3. Проверка перед заполнением. Система показывает найденные поля с чекбоксами и значениями: лишнее снимается, неверное правится. Ничего не записывается в карточку без подтверждения.
  4. Связь со справочниками. Значения подставляются из уже существующих справочников, а не создают дубли.
  5. Пакетная обработка. Если документ отсканирован в несколько изображений, они распознаются за один запуск, а результаты объединяются: при расхождении берётся значение с наибольшей уверенностью.

Такой сценарий экономит время менеджера и не требует от него разбираться в том, какая модель и где именно обрабатывает документ.

Кейс: как это сделано в одном из моих сервисов

В одном из своих сервисов я реализовал ровно эту схему: распознавание встроено прямо в карточку, достаёт реквизиты из сканов и фотографий и заполняет ими поля — без ручного переноса и без переключения между окнами.

Для меня как разработчика важны три вещи, которые я закладываю в такие системы с самого начала:

  • распознавание запускается только по явному действию пользователя;
  • содержимое документов не попадает ни в базу знаний сервиса, ни в контекст AI-ассистента;
  • результат не дублируется: повторная обработка того же файла не создаёт новых записей.

152-ФЗ: что важно, если в документах персональные данные

Документы почти всегда содержат персональные данные: ФИО, адрес, паспорт, реквизиты. Значит, на распознавание распространяются требования 152-ФЗ, и вот на что я обращаю внимание.

Локализация. Базы с персональными данными граждан РФ должны храниться в России (ч. 5 ст. 18). Если распознавание идёт через зарубежный API, а результаты оседают в зарубежном хранилище — это нарушение.

Трансграничная передача. Отправка сканов с персональными данными в зарубежную модель — это трансграничная передача (ст. 12). До её начала требуется уведомить Роскомнадзор, а для ряда стран передача ограничена или запрещена. Проще говоря: документ с паспортом не должен уходить на зарубежный сервер «просто потому, что модель дешевле».

Псевдонимизация. Если импортная модель всё же нужна, из текста перед отправкой убирают сами персональные данные: имена, телефоны, почту, номера заменяют обезличенными метками. Модель работает с обезличенным текстом, а исходные данные остаются в контуре заказчика. Такой слой маскирования я делаю отдельным сервисом, через который проходит всё, что уходит во внешнюю модель.

Согласие, цели и сроки. Пользователь должен знать, зачем обрабатываются данные, и дать согласие. Нужно определить сроки хранения и порядок уничтожения, ограничить доступ сотрудников, вести журнал.

Ответственность. Штраф за неуведомление Роскомнадзора об обработке — 100–300 тыс. ₽, за несообщение об утечке в течение 24 часов — 1–3 млн ₽. Это не абстрактные риски, а прямые расходы, которые дешевле предотвратить.

Практический вывод: сам этап распознавания (OCR) разумно держать в российском контуре, а языковую модель выбирать осознанно — с маскированием данных, если она импортная.

Цены: отечественные и импортные модели

Ниже — ориентиры по стоимости обработки (данные по фактическому счёту за сентябрь 2026; цены меняются, проверяйте перед расчётом).

Модель / сервис Вход, ₽ за 1000 токенов Выход, ₽ за 1000 токенов
YandexGPT Pro 5.1 (Яндекс) ≈0,8 ≈0,8
Qwen 3.6 35B на Yandex AI Studio 0,2 0,3
DeepSeek chat (импорт) ≈0,02 ≈0,09
Yandex Vision OCR ≈0,13 ₽ за изображение

Что из этого следует:

  • Импортная модель дешевле за токен — в разы. Если объёмы большие, разница в деньгах заметна.
  • Отечественный OCR стоит копейки. Распознавание печатного текста у Яндекса — порядка 13 копеек за изображение. Именно этот этап трогает персональные данные, и его выгодно и правильно делать в РФ.
  • Отечественные генеративные модели дороже импортных, но дают договор с российским юрлицом, оплату в рублях, сертификаты и отсутствие трансграничной передачи. Для документов с персональными данными это часто решающий фактор.

Отсюда рабочая схема: распознавание — в российском контуре, разбор текста — либо на отечественной модели, либо на импортной, но только с псевдонимизацией. Для чувствительных данных есть и третий вариант — локальная модель на своих серверах, когда важна полная автономность.

Почему удобнее в своей CRM

Готовый внешний сервис распознавания закрывает только одну операцию. Когда распознавание встроено в вашу систему, выигрыш больше:

  • документ обрабатывается там же, где живёт сделка, — без переключений и повторного ввода;
  • значения сразу попадают в ваши справочники и права доступа;
  • данные не уходят третьим лицам сверх необходимого;
  • правила обработки персональных данных вы определяете сами.

Если у вас уже есть CRM, 1С или собственная система учёта, распознавание документов — один из самых окупаемых сценариев автоматизации: он убирает ручной ввод, не меняя привычный процесс.

Посмотрите услуги «ИИ-ассистент и автоматизация» и «Интеграция 1С с CRM». Нужно встроить распознавание документов в вашу систему — напишите мне, разберу задачу и предложу схему.

Читайте также

Обсудим вашу задачу?

Бесплатно разберу процессы и предложу решение. Ставка — 1 000 ₽/нормо-час.