Распознавание документов и речи

Распознавание в платформе работает двумя контурами. OCR превращает в текст изображения и сканы: его настраивает администратор в разделе Администрирование → LLM и сценарии → Провайдеры OCR. Распознавание речи — транскрибация аудио и видео — входит в поставку платформы и работает сервисами поставки без отдельной настройки; журнал расшифровок доступен в центре активности. Разбор офисных документов и PDF с текстовым слоем не относится к распознаванию — им занимается сервис Docling, описанный в главе Docling: структурный импорт документов.

Страница «Провайдеры OCR»: таблица с колонками «Активен», «Провайдер», «LLM и модель», «Изображение», «Изменён», у одной строки бейдж «По умолчанию»
Список OCR-провайдеров инсталляции

Что вам понадобится

  • глобальная роль admin — раздел Администрирование закрыт для остальных пользователей;
  • активный провайдер языковых моделей (LLM) с моделью, которая понимает изображения.

Как настроить OCR-провайдер

OCR-провайдер — это связка языковой модели, которая понимает изображения, и правил передачи картинки. Откройте Администрирование → LLM и сценарии → Провайдеры OCR (/settings/administration/llm/ocr-providers), нажмите Создать провайдер и заполните форму.

  1. Включите переключатель Провайдер активен.
  2. Укажите Название — под этим названием провайдер виден в списке.
  3. Выберите LLM-провайдер из подключённых провайдеров языковых моделей.
  4. Выберите Модель — платформа берёт список из каталога моделей выбранного провайдера.
  5. Задайте параметры в секции Передача изображения.
  6. Нажмите Создать.

В секции Параметры запроса поле Дополнительные поля принимает JSON-объект, который платформа добавляет в тело запроса к модели: так вы задаёте нестандартные параметры конкретного сервиса. После сохранения проверьте связку кнопкой Проверить — платформа отправляет тестовый vision-запрос и показывает ответ модели.

Как выбрать способ передачи изображения

Переключатель Способ передачи определяет, в каком виде картинка уходит модели, и от этого выбора зависят остальные поля секции Передача изображения.

ПараметрЗначенияКогда менять
Способ передачиСсылка на файл, Base64 в запросеМодель не принимает изображения в теле запроса — выберите ссылку
ДетализацияАвтоматически, Низкая, ВысокаяМелкий шрифт и плотные таблицы читаются лучше на высокой детализации, но запрос стоит дороже
Улучшение изображенийВключено или выключеноВыключите, чтобы сравнить качество распознавания без предобработки

При способе Ссылка на файл платформа публикует изображение через файловый сервис поставки и отдаёт модели временную ссылку. Способ Base64 в запросе обходится без публикации: картинка уходит внутри запроса.

Переключатель Улучшение изображений включает предобработку: платформа оценивает качество картинки, увеличивает мелкий текст и поднимает резкость и контраст слабых снимков.

Как назначить основной OCR-провайдер

Распознавание использует ровно одного провайдера — того, который активен и помечен бейджем По умолчанию. Откройте меню в строке нужного провайдера и выберите Назначить по умолчанию: прежний основной провайдер теряет пометку.

Переключатель Активен запрашивает подтверждение и при включении, и при выключении. Настройки отключённого провайдера сохраняются, но распознавание им не пользуется.

Важно. Пока основной провайдер отключён или удалён и не назначен новый, распознавание изображений в платформе недоступно.

Частые вопросы

Пользователь загрузил скан, но текст не распознан

Активного основного OCR-провайдера нет либо его связка не работает. Проверьте:

  • в списке Провайдеры OCR есть строка с бейджем По умолчанию и включённым переключателем Активен;
  • у этого провайдера выбраны LLM-провайдер и Модель, а сам провайдер языковых моделей активен;
  • кнопка Проверить в панели провайдера возвращает успешный ответ.

Где посмотреть историю транскрибаций

Распознавание речи работает из коробки и не требует настройки в этой главе. Историю расшифровок с этапами обработки и ошибками ведёт журнал Запуски ASR в центре активности — см. Центр активности.

Что дальше