Разборы · Обработка документов

Какая точность у распознавания документов на самом деле?

Короткий ответ

Любая названная точность, к которой не приложены три вещи — какое поле, какой состав документов и что считается правильным, — это маркетинг. Число, которое действительно предсказывает ваш результат, другое: доля сквозного прохода, то есть документов, прошедших весь путь без участия человека.

По полям
Точность разных полей одной страницы отличается радикально
Ваши документы
Единственная выборка, чей результат предсказывает ваш
Сквозной проход
Число, которое превращается в сэкономленные часы
Автор: Max Pochinsky · Обновлено Август 2026 · Написано для тех, кто оценивает проект, а не для поисковиков

Почему одно число это не описывает

Возьмите счёт. Итоговая сумма — одна аккуратно отформатированная цифра в предсказуемом месте, читается почти идеально. Название поставщика нужно сопоставить с вашим справочником, где две записи различаются организационно-правовой формой. Строки таблицы идут через разрыв страницы, а дата поставки может быть вписана от руки на полях. У этих четырёх полей нет одной точности — у них четыре, и они далеко друг от друга.

Дальше вопрос, что значит «правильно». Поставщик сопоставлен с верной головной компанией, но не с тем юрлицом — это правильно? Дата прочитана верно, но в другом формате — правильно? Два подрядчика могут назвать очень разные числа на одних и тех же документах просто потому, что ответили на этот вопрос по-разному, и ни один из них не врёт.

Измерения, которые имеет смысл иметь

01

Точность по каждому полю. Как часто каждое отдельное поле в точности верно. Это показывает, где работа, и это единственный срез, в котором вообще можно что-то улучшать.

02

Точность по документу. Как часто верны все поля документа одновременно. Всегда ниже средней по полям и заметно ниже, когда полей много, — именно это число обычно удивляет.

03

Доля сквозного прохода. Доля документов, прошедших весь процесс без вмешательства человека. Именно она конвертируется в сэкономленные часы, и именно её кладут в бизнес-кейс.

04

Доля пропущенных ошибок. Как часто неверное значение принимается с высокой уверенностью и уходит в учёт. Редко и дороже всего остального. Измеряйте отдельно.

05

Калибровка уверенности. Когда система говорит, что уверена, — она права? Хорошо откалиброванная система со средней точностью полезнее самоуверенной с высокой, потому что ей можно доверить решение спросить.

Что на самом деле двигает эти числа

Главное — качество входа. Родной PDF из учётной системы читается почти идеально. Фотография мятого чека под углом при плохом свете — нет, и никакая модель не восстановит информацию, которая не была снята. Если процесс можно изменить так, чтобы документы приходили в цифровом виде, это одно изменение обычно даёт больше, чем любая доводка.

Дальше: сколько у вас разных макетов, сколько содержания вписано от руки, пересекают ли таблицы границу страницы, сколько языков в потоке и — недооценённое — насколько хороши ваши справочники. Половина того, что выглядит ошибкой распознавания, на самом деле ошибка сопоставления: поле прочитано верно, а потом сопоставлено со справочником, где одна компания записана тремя способами.

Как получить настоящее число

Возьмите сто-двести реальных документов, отобранных так, чтобы отражать ваш настоящий состав, а не самые аккуратные экземпляры. Пусть человек вобьёт их руками в те поля, которые вам важны, — это ваша эталонная разметка, и именно её пытаются пропустить. Потом прогоните систему по тому же набору и сравните поле за полем.

Два дня работы дают число, с которым можно действовать, и оно почти всегда меняет план. Видно, какие поля можно автоматизировать уже сегодня, каким нужен порог уверенности, а какие пока остаются ручными. Заодно всплывают расхождения между вашими же проверяющими — и это отдельная находка: если два опытных человека заполняют поле по-разному, никакая система не покажет хороший результат ни против одного из них.

Мы делаем это измерение в рамках бесплатного мини-аудита, на ваших документах, до любой оценки. Любая цифра точности в нашем предложении берётся из этого прогона.

Проектировать под те ошибки, которые будут

Идеального распознавания не бывает, и оно не цель. Рабочая система — та, где ошибки дёшевы: порог уверенности, ниже которого документ уходит человеку; экран проверки, где исходное изображение стоит рядом с извлечённым значением, так что проверка занимает секунды; и правило, что всё выше определённой суммы проверяется независимо от уверенности.

При такой конструкции восемьдесят процентов сквозного прохода — очень хороший результат: четыре документа из пяти никто не трогал, оставшуюся пятую часть быстро проверили с уже заполненным ответом. Погоня за последними процентами обычно стоит дороже, чем когда-либо стоила ручная обработка этих документов.

Уточняющие вопросы

О чём спрашивают дальше.

Не до того, как увидим ваши документы, — и честно этого не может никто. На чистых родных PDF со стабильным макетом ключевые поля действительно выходят на такой уровень. На смеси сканов, фотографий и рукописи — нет. Мы сначала измеряем и кладём в оценку измеренную цифру.

Так и не поняли, стоит ли автоматизировать ваш процесс?

Принесите нам процесс. Мы разберём его вместе с вами бесплатно и дадим прямой ответ — в том числе когда ответ «нет».