Модели и политики
Реестр AI-моделей и политики LLM и OCR — два экрана, которыми вы задаёте, какие модели существуют
в инсталляции платформы, сколько стоит их работа в кредитах и с какими ограничениями они работают.
Реестр вы ведёте в разделе Администрирование → Платформа → AI-модели (/settings/administration/platform/models),
политики — в Администрирование → LLM и сценарии → Политики LLM и OCR (/settings/administration/llm/policies).
Модель, которой нет в реестре, недоступна ни ассистенту, ни сценарию (workflow). Для транскрибации
платформа автоматически поддерживает одну системную запись SpeechRecognition v2. Провайдера LLM
или Embeddings вы подключаете отдельно — см. Провайдеры языковых моделей.
Что вам понадобится
- глобальная роль
admin: раздел Администрирование открыт только ей; - подключённый и активный провайдер нужного типа — языковых моделей или эмбеддингов;
- точный идентификатор модели в API провайдера;
- согласованная с владельцем инсталляции цена модели в кредитах.
Как добавить модель в реестр инсталляции
Откройте Администрирование → Платформа → AI-модели, нажмите Создать модель, заполните форму и нажмите Создать. Так добавляют модели LLM и Embeddings. Платформа сразу добавляет запись в реестр, и модель становится видна там, где её выбирают: в настройках ассистента, в узлах сценария, в настройках индексации и поиска.
- Заполните секцию Основное: название, ключ модели, описание.
- Для типа
LLMзадайте потолки в секции Лимиты — Ответ и Входной промпт. - Для типа
LLMпри необходимости заполните секцию Рассуждения — см. Как включить уровни рассуждений у LLM-модели. - В секции Связка с провайдером выберите Тип модели, затем Провайдер и укажите Ключ у провайдера.
- В секции Тарификация и доступность укажите Единицу списания и ставки.
- Нажмите Создать.
| Поле | Что указать | Обязательно |
|---|---|---|
| Название | Как модель называется в списках интерфейса: Модель-9.1 | Да |
| Ключ модели | Стабильный внутренний ключ записи: model-9-1 | Да |
| Описание | Короткое пояснение для администраторов | Нет |
| Тип модели | LLM или Embeddings — от него зависит список провайдеров | Да |
| Провайдер | Провайдер того же типа; список обновляется при открытии | Да |
| Ключ у провайдера | Идентификатор модели в API провайдера: model-9-1-mini | Да |
Примечание. Ключ модели платформа использует внутри себя, а Ключ у провайдера уходит в запрос к провайдеру.
Пара «провайдер + ключ у провайдера» уникальна: вторую запись с той же парой платформа не сохранит. Если провайдер синхронизирует список моделей, платформа ведёт такую запись сама — см. раздел «Какие записи реестра платформа заводит сама».
Список вы фильтруете строкой поиска и фасетами Тип, Провайдер, Статус. Обычную запись можно перевести между состояниями из меню строки: Архивировать и Восстановить. Системная ASR-модель всегда активна и не архивируется.
Какие записи реестра платформа заводит сама
Записи реестра платформа заводит по каталогу провайдера, который синхронизирует список моделей. Модель, появившаяся в каталоге, становится записью в статусе Активна, а исчезнувшая — переходит в Архив. Вручную создавать и удалять такие записи не нужно; кнопка Создать модель остаётся для моделей, которых в каталоге провайдера нет.
В карточке автоматически заведённой модели есть плашка Карточка заведена автоматически. Пока карточку не меняли вручную, она сообщает: «Состав и состояние ведутся по каталогу провайдера, менять список моделей вручную не нужно.» Ручная правка заменяет это сообщение пояснением о сохранённом исключении.
| Строка плашки | Когда появляется | Что это значит |
|---|---|---|
| Имя задано вручную — автоматика его не перезаписывает. | Изменили Название и сохранили карточку | Следующий проход оставит ваше название. |
| Модель снята вручную — автоматика не включит её обратно даже при появлении в движке. | Выключили Модель активна и доступна в реестре или выбрали Архивировать | Запись останется в Архив, пока вы не включите её сами. |
Тарификацию автоматика не ведёт. Проверьте ставки Входные токены и Выходные токены в секции Тарификация и доступность, иначе работа модели считается бесплатной; Уровень стоимости — только подпись, а не цена.
Если созданная вручную запись совпала с моделью из каталога того же провайдера по паре «провайдер + ключ у провайдера», со следующей синхронизации карточку ведёт автоматика, сохраняя вручную заданные название и архивацию. Синхронизацией списка моделей управляет страница провайдера; в реестре моделей кнопки Синхронизировать сейчас нет.
Что означает плашка «Нет в движке» у модели
Плашка Нет в движке рядом с названием означает, что модель исчезла из каталога системного провайдера. Платформа держит запись активной ещё 30 минут; плашка показывает остаток выдержки, например Нет в движке · 12 мин.
| Вид | Значение | Что делать |
|---|---|---|
Активна без плашки | Модель есть в каталоге | Ничего делать не нужно. |
Активна с Нет в движке · N мин | Модель исчезла, до архивации осталось указанное время | Верните модель в контур или дождитесь архивации. |
Активна с Нет в движке · выдержка истекла | Выдержка закончилась, ближайший проход заархивирует запись | Назначьте другую модель по умолчанию, если нужна эта. |
Архив | Запись сохранена и скрыта из выбора | При необходимости восстановите её из меню строки. |
Плашка появляется только у моделей системного провайдера. Если модель вернулась в каталог до конца выдержки, следующий проход снимет плашку и сохранит ту же запись, её ставку и историю потребления. Ускорить проверку можно кнопкой Синхронизировать сейчас на странице провайдера.
При автоматическом выборе запасной модели платформа ставит модели в выдержке в конец очереди и использует их, только если других активных LLM-моделей не осталось.
Какие лимиты токенов задаёт карточка модели
Секция Лимиты появляется только у моделей типа LLM и содержит два поля — Ответ
и Входной промпт. Оба задают потолки для всех ассистентов и действий, которые работают
на этой модели.
| Параметр | Что делает | По умолчанию | Когда менять |
|---|---|---|---|
| Ответ | Потолок длины ответа модели | 16 000 токенов | Модель отвечает отказом на длинный ответ |
| Входной промпт | Потолок на весь промпт целиком | 32 000 токенов | Контекстное окно модели больше или меньше дефолта |
Значение в поле Ответ работает как потолок: ассистент или действие могут запросить меньше, но не больше. Минимум для поля Входной промпт — 1 000 токенов, значения ниже платформа поднимает до минимума. Под полями карточка показывает предупреждение «Убедитесь, что контекстное окно модели не меньше N токенов»: N — сумма обоих лимитов. Оценка консервативная, реально в модель уходит меньше.
Что отбрасывается, когда промпт не помещается
Бюджет входного промпта считается на весь запрос: системная инструкция, история чата, контекст из баз знаний, вложения и стенограммы, сообщение участника и накладные расходы шаблона. Когда запрос не помещается, платформа отбрасывает содержимое в фиксированном порядке — сначала историю чата целыми сообщениями от самых старых, затем вложения, затем фрагменты из баз знаний, и лишь в последнюю очередь обрезает текст сообщения. Системная инструкция сохраняется всегда, а в промпт добавляется пометка об обрезке.
Если провайдер отдаёт токенизатор, платформа считает длину промпта точно и заодно узнаёт реальное контекстное окно модели: окно меньше настройки выигрывает у настройки. Если токенизатора нет, длина оценивается по классам символов, и оценка намеренно завышается — заниженная привела бы к отказу модели уже после того, как часть документа отброшена.
Как включить уровни рассуждений у LLM-модели
В карточке LLM откройте секцию Рассуждения, включите Модель поддерживает рассуждения и заполните Конфигурацию JSON.
modes задаёт доступные пользователю уровни, defaultMode — уровень для нового чата или сброшенного
выбора, labels — подписи, output.enabled — можно ли показывать ход рассуждений во время ответа.
defaultMode обязан входить в modes; дубли, неизвестные режимы и заплатки для режима вне modes
платформа не сохранит.
Карточка модели отвечает за доступные уровни, а провайдер — за преобразование уровня в тело запроса.
Каждый режим должен передаваться либо через reasoningMapping провайдера, либо через
request.modePatches карточки модели. При несовместимой паре платформа показывает ошибку при
сохранении вместо конфигурации, которая выглядела бы рабочей, но не влияла на ответ. Одинаковый
эффективный режим используется в обычном и RAG-чате.
Как настроить тарификацию модели
Для LLM и Embeddings цену задаёт секция Тарификация и доступность: сначала выберите
Единицу списания, затем заполните ставки. Выбирайте 1 млн токенов — ставки в форме заданы
за миллион токенов. Вариант 1 тыс. токенов оставлен для ранее заведённых записей и с полями
ставок не связан.
| Поле | Для каких моделей | Что означает |
|---|---|---|
| Единица списания | LLM, Embeddings | 1 млн токенов или устаревший вариант 1 тыс. токенов |
| Уровень стоимости | LLM, Embeddings | Метка для пользователя: Бесплатно, Низкая, Средняя, Высокая, Очень высокая |
| Входные токены | LLM, Embeddings | Кредиты за миллион входных токенов |
| Выходные токены | LLM | Кредиты за миллион выходных токенов |
| Кредиты за минуту | ASR | Кредиты за начатую минуту аудио |
Флажок Бесплатная модель — кредиты за токены не списываются обнуляет ставки и блокирует поля. Снятый флажок Модель активна и доступна в реестре убирает обычную запись из выдачи, не удаляя её. Уровень стоимости — только подпись рядом с ценой: на расчёт списания он не влияет, списание считается по ставкам.
Как задать цену распознавания речи
Откройте Администрирование → Платформа → AI-модели, выберите фильтр Тип: ASR и нажмите SpeechRecognition v2. В панели Тарификация ASR в секции Стоимость распознавания укажите Кредиты за минуту; флажок Бесплатное распознавание отключает списание. Длительность аудио округляется вверх: запись длиной 1 минута 1 секунда тарифицируется как 2 минуты.
Если списывать кредиты за распознавание не нужно, включите Бесплатное распознавание. Отдельный тариф ASR создавать не нужно: тариф пространства задаёт общий бюджет, а эта ставка — цену операции. Название, провайдер, активность и другие технические поля системной ASR-модели не редактируются.
В секции Предельное время распознавания задайте Часов на задачу и нажмите Применить. Пустое поле использует дефолт платформы — 24 часа. Если настройку перекрывает конфигурация развёртывания, интерфейс показывает предупреждение Значение перекрыто переменной окружения и блокирует поле с кнопкой.
Как назначить модель по умолчанию для ассистентов
Откройте Администрирование → LLM и сценарии → Политики LLM и OCR, вкладку Ассистенты и чаты, блок Модели ассистентов. В таблице собраны все активные LLM-модели с активным провайдером. Переключатель в первой колонке решает, увидит ли участник модель в настройках ассистента; пункт меню строки Назначить по умолчанию ставит метку По умолчанию. После правок нажмите Сохранить.
Модель по умолчанию работает для системного ассистента Unica Chat и для всех ассистентов, у которых в списке моделей выбран пункт По умолчанию: смена модели в политике переводит их на новую модель без правки каждого ассистента. Сохранить политику без модели по умолчанию платформа не даёт — появляется сообщение «Выберите модель по умолчанию среди доступных моделей».
Эту же модель наследует агент, если в Администрирование → LLM и сценарии → Настройки агента поле Основная модель агента пусто: в карточке Текущие профили такое состояние показано как По умолчанию. В сценариях модель берут узлы Шаг ИИ и Агент, когда в Источник модели выбрана Модель по умолчанию, а узел Поиск по знаниям — когда это значение выбрано в Источник модели ответа на вкладке RAG. У нового узла Поиск по знаниям это значение выбрано сразу; у новых Шаг ИИ и Агент по умолчанию стоят соответственно Модель узла и Основная модель агента. В ранее созданных узлах сохраняется выбранный источник.
Отдельной настройки модели для Unica Chat нет: системный ассистент всегда работает на модели по умолчанию.
| Ситуация | Что делает платформа |
|---|---|
| Модель выключена переключателем | Исчезает из списка моделей ассистента |
| Выключена модель, выбранная у ассистента явно | Ассистент переходит в режим По умолчанию |
| Модель по умолчанию заменена, а Основная модель агента пустая | Агент переходит на новую модель без правки настроек агента |
| У узла сценария выбрано Модель по умолчанию | Узел работает на модели из этого блока и меняется вместе с ней |
| Модель по умолчанию удалена или недоступна | Берётся первая доступная активная LLM-модель |
| Активных LLM-моделей с активным провайдером нет | Таблица пуста, ассистенты остаются без модели |
Как настроить Unica Chat, названия чатов и улучшение промптов
Вкладка Ассистенты и чаты, кроме блока Модели ассистентов, содержит ещё три блока — они настраивают сервисные функции платформы. Каждый блок вы сохраняете отдельной кнопкой, а редко используемые поля раскрывает ссылка Расширенные настройки.
| Блок | Что настраивает | Основные поля |
|---|---|---|
| Unica Chat | Поведение системного ассистента | Системный промпт, Температура, Top P |
| Автогенерация названий чатов | Короткое название по первому сообщению | Включить генерацию, Провайдер LLM, Модель, Резервный заголовок |
| Улучшение промптов | Кнопку Улучшить в редакторе ассистента | Включить улучшение, Провайдер LLM, Модель, Мета-промпт в расширенных настройках |
В блоках Автогенерация названий чатов и Улучшение промптов значение Наследовать модель по умолчанию в полях Провайдер LLM и Модель означает, что функция работает на модели из блока Модели ассистентов. Отдельный выбор нужен, когда для служебных запросов вы хотите модель дешевле основной.
В расширенных настройках автогенерации вы задаёте инструкцию и шаблон промпта; шаблон обязан содержать
токен {{messageSnippet}}, дополнительно поддерживается {{maxWords}}. Там же вы ограничиваете длину
входа и выхода: Макс. слов из сообщения, Макс. символов из сообщения, Макс. слов в заголовке,
Макс. символов в заголовке. Если генерация выключена, чат получает значение поля Резервный заголовок.
Под каждым полем промпта платформа показывает счётчик формата <введено> из 50 000 символов.
Он есть у Системный промпт блока Unica Chat, Мета-промпт блока Улучшение промптов и
у Инструкция и Промпт в расширенных настройках Автогенерация названий чатов. Предел общий
для этих промптов и не настраивается. Текст сверх предела остаётся в поле, но счётчик становится
красным и показывает, сколько символов убрать; сохранение платформа отклоняет до исправления.
Как ограничить нагрузку на модели и распознавание
Вкладка Производительность (/settings/administration/llm/policies?tab=performance) собирает
ограничители, которыми вы защищаете инсталляцию и внешние сервисы от перегрузки. Блок
Производительность ассистентов управляет очередью действий ассистентов, блок
Производительность OCR — параллелизмом распознавания сканов, общим для чата и баз знаний,
блок Расшифровка записей — тем, сколько аудио- и видеозаписей распознаются одновременно при
загрузке в базы знаний.
| Параметр | Что делает | По умолчанию | Когда менять |
|---|---|---|---|
| Порядок очереди | Равномерно распределяет места между пространствами, По порядку запускает задачи по времени поступления | Равномерно | Одно пространство занимает всю очередь |
| Задач одновременно | Сколько действий выполняет один сервер | 4 | Сервер недогружен или перегружен |
| На пространство, На ассистента, На пользователя | Потолки очереди для режима Равномерно | 2, 1, 1 | Один источник вытесняет остальных |
| LLM, сек | Сколько ждать один ответ модели | 600 | Модель отвечает дольше таймаута |
| Страниц одного документа | Сколько страниц одного скана распознаётся разом | 2 | Скан обрабатывается слишком долго |
| Документов параллельно | Сколько файлов из очереди импорта идут одновременно | 4 | Очередь импорта не разбирается |
| Документов пространства в индексации | Сколько документов одного пространства индексируются одновременно, остальные слоты достаются другим пространствам | 4 | Пакет одного пространства блокирует индексацию остальных |
| Документов пространства в Docling | Сколько документов одного пространства одновременно разбирает Docling; пока он работает, обработчики приёма свободны | 2 | Загрузка одного пространства задерживает разбор документов в других, или Docling простаивает при единственной загрузке |
| Глобальный потолок запросов к OCR | Общий потолок одновременных запросов к OCR-модели | 8 | Провайдер отвечает 429 или таймаутами |
| Записей одного пользователя | Сколько записей одного человека распознаются одновременно при загрузке в базы знаний; остальные ждут своей очереди | 2 | Коллеги долго ждут расшифровки за большой загрузкой одного человека |
| Записей одного пространства | То же для всего рабочего пространства | 8 | Большая загрузка одного пространства задерживает расшифровку в других |
Поля На пространство, На ассистента и На пользователя видны только при порядке очереди
Равномерно. Глобальный потолок OCR — главный ограничитель: если он ниже, чем произведение страниц
на документы, реально выполняется столько запросов, сколько задано в нём. Допустимые значения
параллелизма OCR — целые в диапазоне 1–64.
В блоке Производительность OCR раздел Время ожидания содержит два поля:
- Один запрос OCR, сек — сколько ждать распознавания одного изображения или страницы в чате и базе знаний. По умолчанию — 300 секунд.
- OCR одного документа в чате, сек — общий лимит с учётом ожидания и повторных попыток. По умолчанию — 600 секунд. Сейчас применяется к сканированным PDF; распознавание изображений внутри Word эта настройка не включает.
Допустимы целые значения от 1 до 7200 секунд. Лимит документа должен быть не меньше лимита запроса. Нажмите Сохранить настройки OCR: следующие обработки используют новые значения без перезапуска сервера; начатые обработки продолжаются со своими лимитами. Если в окружении для базы знаний задан отдельный таймаут, его действующее значение показано под общим полем; после сохранения общий лимит применяется и к базе знаний.
Примечание. Настройка в интерфейсе имеет приоритет над переменной окружения, а переменная — над встроенным значением по умолчанию.
Общего ограничения расшифровки на всю установку нет: записи копятся в очереди сервиса распознавания, а он сам распределяет их по своим экземплярам. Пока запись распознаётся, она не занимает исполнителя приёма документов, поэтому остальные документы обрабатываются без ожидания. Расшифровку в чатах эти поля не ограничивают. Нажмите Сохранить в блоке — новые значения действуют без перезапуска.
Ссылка Расширенные настройки в блоке Производительность ассистентов раскрывает раздел Таймаут с полем LLM, сек и раздел Если сервер пропал с полями Проверка активности, сек и Перехват задачи, сек: как часто работающий сервер подтверждает, что задача ещё у него, и через сколько секунд молчания её сможет забрать другой сервер. Интервал проверки должен быть меньше срока перехвата, иначе платформа не сохранит настройки.
Частые вопросы
Почему платформа не сохраняет правку карточки модели
Карточка сохраняется вместе с версией записи. Если другой администратор успел сохранить эту модель раньше, платформа сообщает: «Модель была изменена в другой вкладке. Обновите данные и повторите изменения.». Закройте карточку, откройте её заново и повторите правку. То же правило действует для действий Архивировать и Восстановить.
Почему новой модели нет в списке моделей ассистента
Модель попадает в список ассистента только при трёх условиях сразу. Проверьте:
- в карточке модели включён флажок Модель активна и доступна в реестре;
- провайдер модели активен на странице Провайдеры LLM;
- в блоке Модели ассистентов переключатель модели включён и политика сохранена.
Почему платформа не сохраняет модель и требует ключ провайдера
Поле Ключ у провайдера обязательно, как только выбран провайдер, а пара «провайдер + ключ» должна быть уникальной. Проверьте:
- поле Ключ у провайдера заполнено и совпадает с идентификатором в API провайдера;
- такой пары ещё нет у другой записи реестра, в том числе архивной;
- выбран провайдер того же типа, что и модель.
Почему по модели не списываются кредиты
Списание считается по ставкам карточки модели, а не по уровню стоимости. Проверьте:
- флажок Бесплатная модель снят;
- у поля Единица списания выбран
1 млн токенов, а не1 тыс. токенов; - ставки Входные токены и Выходные токены заполнены ненулевыми значениями.
Для ASR откройте системную модель SpeechRecognition v2 и проверьте, что Бесплатное распознавание выключено, а поле Кредиты за минуту содержит ненулевую ставку. Списание выполняется один раз после успешного распознавания и считается по начатым минутам аудио.
Почему ассистент теряет начало длинного документа
Промпт не помещается в бюджет входного контекста модели, и платформа отбрасывает лишнее. Проверьте:
- значение поля Входной промпт в карточке модели;
- контекстное окно модели у провайдера не меньше суммы обоих лимитов;
- документ передан вложением, а не вставлен в сообщение целиком.
Индикатор контекста в поле ввода чата показывает ≈ <введено> из <бюджет> токенов. При
переполнении он сообщает: «Ранние сообщения не передаются модели. Начните новый чат, чтобы
освободить контекст.». Бюджет берётся из поля Входной промпт карточки модели.
Что дальше
- Провайдеры языковых моделей — подключить провайдера, к которому привязываются модели.
- Провайдеры эмбеддингов — настроить модели для индексации и поиска.
- Первый запуск платформы — порядок настройки инсталляции с нуля.
- Центр активности — посмотреть, как модели отработали в запусках LLM.
- Ассистенты — выбрать модель в настройках ассистента.