ИИ для работы с документами и таблицами помогает извлекать реквизиты, сравнивать версии, объяснять формулы и готовить черновики отчётов. Ошибка в распознавании, формуле или источнике может перейти в договор, платёж или управленческое решение, поэтому результат нужно проверять по исходному файлу и контрольным расчётам. В статье — два воспроизводимых процесса для документов и таблиц, схема RAG и требования к безопасному пилоту.

Коротко о главном:

  • начинайте с узкой операции и заранее задавайте критерии приёмки;
  • требуйте ссылку на страницу, пункт, строку или ячейку исходника;
  • отделяйте извлечение данных от их интерпретации и генерации текста;
  • проверяйте формулы на небольшом примере с известным результатом;
  • сверяйте условия хранения, обучения на данных и доступа для конкретного продукта и тарифа;
  • не давайте системе автоматически отправлять, подписывать или оплачивать документы на этапе пилота.

ИИ для работы с документами и таблицами: какие задачи выбрать

Подходящая задача имеет понятный вход, проверяемый выход и ограниченную цену ошибки. Например, из счёта нужно извлечь номер, дату, контрагента и итоговую сумму; из таблицы — объяснить формулу или найти строки, нарушающие заданное правило.

Начать можно с таких операций:

ОбъектЗадача для ИИКак проверить
Договорнайти пункты о сроке, оплате и расторженииоткрыть указанные страницы и сверить цитаты
Счёт или актизвлечь реквизиты в заданные полясравнить с оригиналом и контрольной суммой
Две версии документасоставить список смысловых измененийпроверить каждый фрагмент в обеих версиях
Таблица продажобъяснить структуру и предложить проверкисверить названия листов, столбцов и диапазонов
Формулаобъяснить логику или подготовить вариантпротестировать на строках с известным ответом
Текстовые отзывывыделить темы по заданной рубрикевручную проверить выборку и спорные строки

Неудачный пилот звучит как «пусть ИИ ведёт весь документооборот». Удачный — «извлечь шесть полей из одного типа счёта, показать страницу-источник и передать результат сотруднику на утверждение».

Процесс работы с документом

Документ удобно обрабатывать в пять этапов: подготовка, извлечение, проверка, интерпретация и выпуск результата. Если смешать их в одном запросе, будет трудно понять, где появилась ошибка.

Шаг 1. Подготовьте источник

Убедитесь, что файл открывается, страницы расположены в правильном порядке, а скан читаем. Для сравнения версий используйте документы с понятными именами и датами. Если в PDF несколько приложений, перечислите их отдельно.

Скан, фотография таблицы и PDF со сложной вёрсткой требуют особой осторожности. В официальном руководстве по анализу данных в ChatGPT OpenAI предупреждает, что точное извлечение значений из изображений и сложных табличных макетов может быть ненадёжным; когда важны числа, предпочтителен структурированный файл.

Шаг 2. Задайте схему результата

Не просите просто «проанализировать договор». Перечислите поля, формат и поведение при отсутствии данных.

Извлеки из приложенного договора сведения в таблицу:
- номер и дата;
- стороны;
- предмет;
- цена и валюта;
- срок действия;
- условия расторжения.

Для каждого значения укажи страницу и дословный фрагмент-основание.
Если сведений нет, напиши «не найдено».
Не делай юридических выводов и не заполняй пробелы предположениями.

Такая схема отделяет найденный текст от вывода модели. Она также позволяет автоматически проверять, заполнены ли обязательные поля.

Шаг 3. Проверьте извлечение

Сотрудник открывает указанные страницы и сверяет значения. Для суммы проверяют валюту, НДС, разделители разрядов и итог по строкам. Для даты — что это именно дата договора, а не приложения или подписи. Для названия стороны — что модель не перепутала заказчика и исполнителя.

Если тип документа повторяется, ведите журнал ошибок: неверно распознанная дата, потерянное приложение, перепутанный столбец, пропущенная строка. Он полезнее общей оценки «ответ выглядит хорошо» и помогает решить, готова ли задача к автоматизации.

Шаг 4. Отдельно запросите интерпретацию

После проверки извлечённых данных можно попросить ИИ сравнить условия, подготовить резюме или отметить отклонения от утверждённого шаблона. Каждое замечание должно содержать ссылку на исходный пункт. Для права, финансов и других задач с высокой ценой ошибки итог утверждает профильный специалист.

Шаг 5. Выпустите документ

Генерацию письма, карточки в системе или черновика отчёта выполняйте только из проверенной таблицы фактов. Перед отправкой сравните итог с источником и убедитесь, что модель не добавила новые обещания, сроки или реквизиты. Подход к текстовой вычитке подробно разобран в статье «ИИ для написания текстов».

Что такое RAG и чего он не гарантирует

RAG — Retrieval-Augmented Generation, или генерация с извлечением. В классической схеме, описанной в работе Lewis и соавторов, генеративная модель получает найденные внешние материалы вместе с запросом и использует их при подготовке ответа.

В корпоративном сценарии процесс обычно выглядит так:

  1. Документы загружают и разбивают на фрагменты вместе с метаданными.
  2. Фрагменты индексируют в базе знаний.
  3. По запросу система извлекает наиболее подходящие части.
  4. Модель формирует ответ и показывает использованные фрагменты или ссылки.

Схема RAG: загрузка документов, база знаний, поиск и ответ со ссылкой на найденный фрагмент

RAG связывает ответ с найденными материалами. Наличие ссылки упрощает проверку, но не гарантирует, что фрагмент выбран правильно или вывод из него верен.

RAG полезен для вопросов по регламентам, технической документации, базе поддержки и архиву договоров. Обновление индекса позволяет подключать новые документы без переобучения основной модели.

При этом RAG не устраняет ошибки автоматически. Система может не найти нужный фрагмент, выбрать устаревшую редакцию, потерять таблицу при разбиении документа или неверно интерпретировать найденный текст. NIST отдельно описывает риск confabulation — уверенно сформулированного, но ошибочного содержания в ответах генеративных систем.

Контрольные точки для базы знаний

  • у каждого документа есть владелец, версия, дата действия и уровень доступа;
  • устаревшие редакции исключены из основного поиска или явно помечены;
  • ответ показывает цитату и ссылку на конкретный фрагмент;
  • система умеет ответить «не найдено», если материалов недостаточно;
  • проверяется, что пользователь видит только разрешённые ему документы;
  • действия по ответу выполняются после подтверждения человека.

Документ также может содержать скрытую инструкцию, которая пытается изменить поведение системы. OWASP относит такие сценарии к риску prompt injection, поэтому найденный текст нужно считать данными, а не доверенной командой.

Процесс работы с таблицей

Современные инструменты умеют объяснять формулы, предлагать новые столбцы, находить выбросы и строить сводки. Такие возможности описаны, например, в официальных руководствах Microsoft Copilot в Excel, Gemini в Google Sheets и анализе данных ChatGPT. Доступность функций зависит от продукта, плана и настроек рабочей среды.

Подготовьте таблицу

Перед анализом приведите данные к форме, понятной и человеку, и инструменту:

  • одна строка соответствует одной записи;
  • первая строка содержит уникальные и понятные названия столбцов;
  • даты, суммы и идентификаторы имеют единый формат;
  • внутри диапазона нет пустых строк и скрытых итогов;
  • исходные данные отделены от расчётных и итоговых листов;
  • для справочников указан ключ соединения, например ID клиента или товара.

Сохраните исходный файл только для чтения и работайте с копией. Так предложенное изменение можно отменить, а результат — сравнить с исходником.

Сформулируйте задачу через вход, правило и выход

Вход: лист «Продажи», столбцы Дата, Регион, Менеджер, Выручка, Возврат.
Задача: подготовить сводку выручки и возвратов по регионам за указанный период.
Правила: не менять исходный лист; пропуски и неверные даты вынести отдельно.
Выход: новый лист «Проверка», формулы или код расчёта, список допущений.
Контроль: сумма по регионам должна совпасть с итогом исходного диапазона.

Названия листов и столбцов уменьшают неоднозначность. Microsoft также рекомендует явно указывать столбцы, которые нужно анализировать, и проверять сгенерированный результат.

Проверьте преобразования и формулы

Принцип простой: модель может предложить метод, но арифметику подтверждает воспроизводимый расчёт.

  1. Попросите показать формулу, код или последовательность преобразований.
  2. Проверьте ссылки на листы, абсолютные и относительные диапазоны, локаль и разделители.
  3. Создайте небольшой контрольный набор, для которого ответ известен заранее.
  4. Сравните итоги до и после фильтрации, объединения или удаления дублей.
  5. Проверьте граничные случаи: пустые ячейки, отрицательные значения, дубликаты, ошибки и даты на границе периода.

В документации функции COPILOT Microsoft прямо рекомендует использовать обычные формулы Excel для расчётов, где важны точность и воспроизводимость. Полезная граница: генеративный ИИ помогает сформулировать и объяснить расчёт, а контрольный результат получают детерминированным способом.

Подробные примеры собраны в руководствах по ИИ для Excel и Google Sheets и промптам для формул Excel.

Как превратить текст в таблицу

Из писем, интервью, описаний вакансий и заявок можно извлекать повторяющиеся поля. Сначала определите схему, затем попросите заполнить её только сведениями из исходника.

Преобразуй заявки ниже в таблицу CSV.
Столбцы: request_id, company, contact_name, task, deadline, budget, source_quote.

Правила:
- сохраняй исходные ID;
- не вычисляй и не угадывай отсутствующие значения;
- для пропуска используй null;
- в source_quote добавляй короткий фрагмент, подтверждающий значение;
- спорные строки вынеси в отдельный список.

После извлечения проверьте количество входных и выходных записей, уникальность ID и выборку строк вручную. Если задача регулярная, формализуйте допустимые значения и ошибки: например, список валют, формат даты и обязательные поля.

Очистку таблицы выполняйте отдельным шагом. Руководство по промптам для очистки данных показывает, как сначала диагностировать проблемы, а затем применять изменения к копии.

Как выбрать инструмент без рейтинга, который устареет

Сравнивайте кандидатов на одном наборе реальных обезличенных файлов. В тест должны входить простой документ, сложный документ с таблицей, чистая электронная таблица и файл с заранее известными ошибками.

Оцените не красоту ответа, а проверяемые свойства:

КритерийКонтрольный вопрос
Поддержка форматасохраняются ли страницы, таблицы, формулы и ссылки
Прослеживаемостьможно ли перейти к фрагменту, строке или ячейке-источнику
Воспроизводимостьпоказывает ли инструмент формулу, код и допущения
Работа с ошибкамиотмечает ли пропуски вместо догадок
Права доступанаследуются ли разрешения к исходным документам
Управление даннымигде хранятся файлы, каков срок хранения и как удалить данные
Интеграцияможно ли оставить утверждение результата ответственному сотруднику

Для пилота зафиксируйте исходную точку: время выполнения, долю исправлений человеком, типы ошибок и количество возвратов. Сравнивайте один и тот же процесс до и после внедрения. Общая схема выбора инструмента и критерии остановки описаны в статье «ИИ для работы: выбор и внедрение».

Безопасность корпоративных документов

Нельзя делать вывод о конфиденциальности только по словам «бесплатный», «платный» или «корпоративный». Условия различаются между продуктами, типами аккаунтов и настройками. Например, OpenAI публикует отдельные обязательства для business-продуктов и API, Microsoft — правила Enterprise Data Protection, Google — условия защиты данных для Gemini в Workspace. Это примеры того, какие документы нужно проверять, а не универсальная рекомендация конкретного сервиса.

До загрузки файла ответьте на вопросы:

  • есть ли в нём персональные данные, коммерческая тайна или сведения по NDA;
  • разрешено ли использовать этот сервис внутренней политикой;
  • используются ли входы и выходы для обучения моделей;
  • где обрабатываются и хранятся данные;
  • какой срок хранения и доступно ли удаление;
  • кто видит историю запросов, файлы и результаты;
  • действуют ли корпоративные права доступа, аудит и журналирование;
  • передаются ли сведения подключённым приложениям и внешним инструментам.

Если документ содержит персональные данные, применяются требования законодательства и внутренних процедур. Для России это в том числе Федеральный закон № 152-ФЗ; конкретную схему обработки согласует ответственный за безопасность или юрист.

Безопасный пилот использует обезличенные копии, минимально необходимые поля и отдельную тестовую среду. Автоматическую отправку писем, изменение мастер-таблиц, подписание и оплату подключают только после измерения ошибок и настройки подтверждений.

План пилота на одном процессе

  1. Выберите повторяющуюся задачу с понятным владельцем и ограниченной ценой ошибки.
  2. Соберите небольшой репрезентативный набор обезличенных файлов, включая сложные случаи.
  3. Опишите эталонный результат и способ его проверки.
  4. Запустите инструмент в режиме черновика без внешних действий.
  5. Запишите все исправления человека и причины ошибок.
  6. Сравните процесс с исходной точкой и решите: масштабировать, доработать или остановить.

Для первой итерации достаточно одного типа документа или одной таблицы. Цель пилота — доказать качество конкретной операции, а не продемонстрировать максимальное число функций.

FAQ

Может ли ИИ сам проверить финансовую таблицу?

Он может найти подозрительные строки, объяснить формулы и предложить проверки, но итоговые цифры нужно воспроизвести формулами, кодом или контрольной выборкой. Для управленческой или регламентированной отчётности результат утверждает ответственный специалист. Более подробный процесс есть в материале «ИИ для анализа данных».

RAG исключает выдуманные ответы?

Нет. RAG добавляет найденные материалы в контекст и упрощает цитирование, но ошибки возможны на этапах загрузки, поиска и генерации. Требуйте ссылку на источник и допускайте ответ «не найдено».

Можно ли анализировать скан договора?

Можно использовать скан для предварительного извлечения, если он читаем, но критичные реквизиты и таблицы нужно сверить с изображением страницы. Для точных чисел предпочтителен текстовый или структурированный оригинал.

Нужен ли программист для формул Excel?

Для базового объяснения или черновика формулы — не обязательно. Но пользователь должен понимать структуру таблицы, уметь проверить диапазоны и протестировать результат. Автоматизация макросов и интеграций требует отдельного тестирования и контроля доступа.

Как понять, можно ли загружать внутренний документ?

Проверьте классификацию данных, внутреннюю политику, договорные условия продукта, хранение, обучение, регион обработки и права доступа. Если хотя бы один обязательный вопрос не закрыт, используйте обезличенную копию или утверждённую корпоративную среду.

Что сделать прямо сейчас

Возьмите один типовой документ или копию небольшой таблицы. Опишите три проверяемых результата, запретите системе изменять источник, потребуйте ссылки на страницы или ячейки и проведите ручную сверку. Журнал найденных ошибок станет основой для решения о следующем пилоте и покажет, где ИИ действительно помогает процессу.

Источники

Источники и актуальность продуктовых условий проверены 15 сентября 2026 года.

Больше материалов по теме — в разделе «Документы и тексты».