Интеграции
Распознавание документов нейросетью в своей CRM: без ручного ввода и без рисков по 152-ФЗ
17 сентября 2026 г. · 6 мин чтения

Сканы и фотографии документов — это ручной труд: менеджер открывает скан, читает реквизиты и вбивает их в поля карточки. На десятках документов в день это часы работы и неизбежные опечатки. Распознавание нейросетью убирает этот этап: система сама достаёт данные из документа и предлагает заполнить ими поля. Ниже — как это устроено, как встроить распознавание в свою CRM или учётную систему и что важно не забыть, если в документах есть персональные данные.
Что вообще можно распознать
Нейросети хорошо справляются с документами, где данные лежат в предсказуемых местах:
- Реквизиты и поля — наименования, номера, даты, суммы, адреса.
- Бланки, договоры, счета, накладные — типовые формы с постоянной структурой.
- Табличные данные — позиции, количества, цены, итоги.
- Многостраничные PDF — каждая страница распознаётся как отдельный снимок, поэтому подходит и лицевая, и оборотная сторона.
Качественные оценки и решения, которые требуют профессионального суждения, остаются за человеком. Нейросеть снимает рутину, но не заменяет специалиста.
Два разных типа задач
Важно не путать две технологии, потому что у них разная цена и разные требования к данным.
Оптическое распознавание (OCR, vision-модели). Превращает изображение в текст и находит на нём реквизиты. Работает с самим документом, поэтому именно на этом этапе в обработку попадают персональные данные.
Языковая модель (LLM). Разбирает уже извлечённый текст: приводит поля к единому виду, сопоставляет со справочником, проверяет логику, а в некоторых задачах — анализирует структуру документа целиком и расставляет в нём переменные для автозаполнения.
Разделение важно ещё и потому, что OCR можно выполнить полностью в российском контуре за копейки, а языковую модель выбрать отдельно — отечественную или импортную, с маскированием данных.
Как встроить это в свою систему
Распознавание не должно быть отдельным сервисом «в соседней вкладке». Оно работает, когда встроено прямо в рабочий процесс:
- Кнопка в карточке. В приложении или вложении документа — кнопка «Распознать». Не нужно скачивать файл, куда-то загружать и возвращать результат вручную.
- Фоновая обработка. Распознавание идёт в очереди, окно можно закрыть — результат сохранится. Как только готов первый файл, его поля уже доступны, не нужно ждать остальные.
- Проверка перед заполнением. Система показывает найденные поля с чекбоксами и значениями: лишнее снимается, неверное правится. Ничего не записывается в карточку без подтверждения.
- Связь со справочниками. Значения подставляются из уже существующих справочников, а не создают дубли.
- Пакетная обработка. Если документ отсканирован в несколько изображений, они распознаются за один запуск, а результаты объединяются: при расхождении берётся значение с наибольшей уверенностью.
Такой сценарий экономит время менеджера и не требует от него разбираться в том, какая модель и где именно обрабатывает документ.
Кейс: как это сделано в одном из моих сервисов
В одном из своих сервисов я реализовал ровно эту схему: распознавание встроено прямо в карточку, достаёт реквизиты из сканов и фотографий и заполняет ими поля — без ручного переноса и без переключения между окнами.
Для меня как разработчика важны три вещи, которые я закладываю в такие системы с самого начала:
- распознавание запускается только по явному действию пользователя;
- содержимое документов не попадает ни в базу знаний сервиса, ни в контекст AI-ассистента;
- результат не дублируется: повторная обработка того же файла не создаёт новых записей.
152-ФЗ: что важно, если в документах персональные данные
Документы почти всегда содержат персональные данные: ФИО, адрес, паспорт, реквизиты. Значит, на распознавание распространяются требования 152-ФЗ, и вот на что я обращаю внимание.
Локализация. Базы с персональными данными граждан РФ должны храниться в России (ч. 5 ст. 18). Если распознавание идёт через зарубежный API, а результаты оседают в зарубежном хранилище — это нарушение.
Трансграничная передача. Отправка сканов с персональными данными в зарубежную модель — это трансграничная передача (ст. 12). До её начала требуется уведомить Роскомнадзор, а для ряда стран передача ограничена или запрещена. Проще говоря: документ с паспортом не должен уходить на зарубежный сервер «просто потому, что модель дешевле».
Псевдонимизация. Если импортная модель всё же нужна, из текста перед отправкой убирают сами персональные данные: имена, телефоны, почту, номера заменяют обезличенными метками. Модель работает с обезличенным текстом, а исходные данные остаются в контуре заказчика. Такой слой маскирования я делаю отдельным сервисом, через который проходит всё, что уходит во внешнюю модель.
Согласие, цели и сроки. Пользователь должен знать, зачем обрабатываются данные, и дать согласие. Нужно определить сроки хранения и порядок уничтожения, ограничить доступ сотрудников, вести журнал.
Ответственность. Штраф за неуведомление Роскомнадзора об обработке — 100–300 тыс. ₽, за несообщение об утечке в течение 24 часов — 1–3 млн ₽. Это не абстрактные риски, а прямые расходы, которые дешевле предотвратить.
Практический вывод: сам этап распознавания (OCR) разумно держать в российском контуре, а языковую модель выбирать осознанно — с маскированием данных, если она импортная.
Цены: отечественные и импортные модели
Ниже — ориентиры по стоимости обработки (данные по фактическому счёту за сентябрь 2026; цены меняются, проверяйте перед расчётом).
| Модель / сервис | Вход, ₽ за 1000 токенов | Выход, ₽ за 1000 токенов |
|---|---|---|
| YandexGPT Pro 5.1 (Яндекс) | ≈0,8 | ≈0,8 |
| Qwen 3.6 35B на Yandex AI Studio | 0,2 | 0,3 |
| DeepSeek chat (импорт) | ≈0,02 | ≈0,09 |
| Yandex Vision OCR | — | ≈0,13 ₽ за изображение |
Что из этого следует:
- Импортная модель дешевле за токен — в разы. Если объёмы большие, разница в деньгах заметна.
- Отечественный OCR стоит копейки. Распознавание печатного текста у Яндекса — порядка 13 копеек за изображение. Именно этот этап трогает персональные данные, и его выгодно и правильно делать в РФ.
- Отечественные генеративные модели дороже импортных, но дают договор с российским юрлицом, оплату в рублях, сертификаты и отсутствие трансграничной передачи. Для документов с персональными данными это часто решающий фактор.
Отсюда рабочая схема: распознавание — в российском контуре, разбор текста — либо на отечественной модели, либо на импортной, но только с псевдонимизацией. Для чувствительных данных есть и третий вариант — локальная модель на своих серверах, когда важна полная автономность.
Почему удобнее в своей CRM
Готовый внешний сервис распознавания закрывает только одну операцию. Когда распознавание встроено в вашу систему, выигрыш больше:
- документ обрабатывается там же, где живёт сделка, — без переключений и повторного ввода;
- значения сразу попадают в ваши справочники и права доступа;
- данные не уходят третьим лицам сверх необходимого;
- правила обработки персональных данных вы определяете сами.
Если у вас уже есть CRM, 1С или собственная система учёта, распознавание документов — один из самых окупаемых сценариев автоматизации: он убирает ручной ввод, не меняя привычный процесс.
Посмотрите услуги «ИИ-ассистент и автоматизация» и «Интеграция 1С с CRM». Нужно встроить распознавание документов в вашу систему — напишите мне, разберу задачу и предложу схему.