Распознавание документов и речи
Распознавание в платформе работает двумя контурами. OCR превращает в текст изображения и сканы: его настраивает администратор в разделе Администрирование → LLM и сценарии → Провайдеры OCR. Распознавание речи — транскрибация аудио и видео — входит в поставку платформы и работает сервисами поставки без отдельной настройки; журнал расшифровок доступен в центре активности. Разбор офисных документов и PDF с текстовым слоем не относится к распознаванию — им занимается сервис Docling, описанный в главе Docling: структурный импорт документов.
Что вам понадобится
- глобальная роль
admin— раздел Администрирование закрыт для остальных пользователей; - активный провайдер языковых моделей (LLM) с моделью, которая понимает изображения.
Как настроить OCR-провайдер
OCR-провайдер — это связка языковой модели, которая понимает изображения, и правил передачи картинки.
Откройте Администрирование → LLM и сценарии → Провайдеры OCR
(/settings/administration/llm/ocr-providers), нажмите Создать провайдер и заполните форму.
- Включите переключатель Провайдер активен.
- Укажите Название — под этим названием провайдер виден в списке.
- Выберите LLM-провайдер из подключённых провайдеров языковых моделей.
- Выберите Модель — платформа берёт список из каталога моделей выбранного провайдера.
- Задайте параметры в секции Передача изображения.
- Нажмите Создать.
В секции Параметры запроса поле Дополнительные поля принимает JSON-объект, который платформа добавляет в тело запроса к модели: так вы задаёте нестандартные параметры конкретного сервиса. После сохранения проверьте связку кнопкой Проверить — платформа отправляет тестовый vision-запрос и показывает ответ модели.
Как выбрать способ передачи изображения
Переключатель Способ передачи определяет, в каком виде картинка уходит модели, и от этого выбора зависят остальные поля секции Передача изображения.
| Параметр | Значения | Когда менять |
|---|---|---|
| Способ передачи | Ссылка на файл, Base64 в запросе | Модель не принимает изображения в теле запроса — выберите ссылку |
| Детализация | Автоматически, Низкая, Высокая | Мелкий шрифт и плотные таблицы читаются лучше на высокой детализации, но запрос стоит дороже |
| Улучшение изображений | Включено или выключено | Выключите, чтобы сравнить качество распознавания без предобработки |
При способе Ссылка на файл платформа публикует изображение через файловый сервис поставки
и отдаёт модели временную ссылку. Способ Base64 в запросе обходится без публикации: картинка
уходит внутри запроса.
Переключатель Улучшение изображений включает предобработку: платформа оценивает качество картинки, увеличивает мелкий текст и поднимает резкость и контраст слабых снимков.
Как назначить основной OCR-провайдер
Распознавание использует ровно одного провайдера — того, который активен и помечен бейджем По умолчанию. Откройте меню ⋯ в строке нужного провайдера и выберите Назначить по умолчанию: прежний основной провайдер теряет пометку.
Переключатель Активен запрашивает подтверждение и при включении, и при выключении. Настройки отключённого провайдера сохраняются, но распознавание им не пользуется.
Важно. Пока основной провайдер отключён или удалён и не назначен новый, распознавание изображений в платформе недоступно.
Частые вопросы
Пользователь загрузил скан, но текст не распознан
Активного основного OCR-провайдера нет либо его связка не работает. Проверьте:
- в списке Провайдеры OCR есть строка с бейджем По умолчанию и включённым переключателем Активен;
- у этого провайдера выбраны LLM-провайдер и Модель, а сам провайдер языковых моделей активен;
- кнопка Проверить в панели провайдера возвращает успешный ответ.
Где посмотреть историю транскрибаций
Распознавание речи работает из коробки и не требует настройки в этой главе. Историю расшифровок с этапами обработки и ошибками ведёт журнал Запуски ASR в центре активности — см. Центр активности.
Что дальше
- Провайдеры языковых моделей — подключить модель, на которой работает OCR.
- Модели и политики — задать тарификацию моделей и лимиты параллельных OCR-запросов.
- Docling: структурный импорт документов — разбор документов с текстовым слоем.
- Администрирование знаний — распознавание сканов при импорте в базу знаний.
- Центр активности — журналы запусков LLM и расшифровок с длительностью и ошибками.