Модели и политики
Реестр AI-моделей и политики LLM и OCR — два экрана, которыми вы задаёте, какие модели существуют
в инсталляции платформы, сколько стоит их работа в кредитах и с какими ограничениями они работают.
Реестр вы ведёте в разделе Администрирование → Платформа → AI-модели (/settings/administration/platform/models),
политики — в Администрирование → LLM и сценарии → Политики LLM и OCR (/settings/administration/llm/policies).
Модель, которой нет в реестре, недоступна ни ассистенту, ни сценарию (workflow), ни транскрибации,
даже если провайдер её отдаёт. Провайдера вы подключаете отдельно — см. Провайдеры языковых моделей.
Что вам понадобится
- глобальная роль
admin: раздел Администрирование открыт только ей; - подключённый и активный провайдер нужного типа — языковых моделей, эмбеддингов или ASR;
- точный идентификатор модели в API провайдера;
- согласованная с владельцем инсталляции цена модели в кредитах.
Как добавить модель в реестр инсталляции
Откройте Администрирование → Платформа → AI-модели, нажмите Создать модель, заполните форму и нажмите Создать. Платформа сразу добавляет запись в реестр, и модель становится видна везде, где выбирают модель: в настройках ассистента, в узлах сценария, в настройках индексации и поиска.
- Заполните секцию Основное: название, ключ модели, описание.
- В секции Связка с провайдером выберите Тип модели, затем Провайдер и укажите Ключ у провайдера.
- Для типа
LLMзадайте лимиты токенов в секции Лимиты. - В секции Тарификация и доступность укажите единицу списания и цену.
- Нажмите Создать.
| Поле | Что указать | Обязательно |
|---|---|---|
| Название | Как модель называется в списках интерфейса: GPT-4o | Да |
| Ключ модели | Стабильный внутренний ключ записи: gpt-4o | Да |
| Описание | Короткое пояснение для администраторов | Нет |
| Тип модели | LLM, Embeddings или ASR — от него зависит список провайдеров | Да |
| Провайдер | Провайдер того же типа; список обновляется при открытии | Да |
| Ключ у провайдера | Идентификатор модели в API провайдера: gpt-4o-mini | Да |
Примечание. Ключ модели платформа использует внутри себя, а Ключ у провайдера уходит в запрос к провайдеру.
Пара «провайдер + ключ у провайдера» уникальна: вторую запись с той же парой платформа не сохранит. Если у провайдера включена синхронизация моделей, привязка может обновиться при следующем импорте.
Список вы фильтруете строкой поиска и фасетами Тип, Провайдер, Статус. Статус Активна
означает, что модель доступна для выбора, Архив — что запись сохранена, но скрыта. Перевести
запись между статусами можно из меню строки: Архивировать и Восстановить.
Какие лимиты токенов задаёт карточка модели
Секция Лимиты появляется только у моделей типа LLM и содержит два поля — Ответ
и Входной промпт. Оба задают потолки для всех ассистентов и действий, которые работают
на этой модели.
| Параметр | Что делает | По умолчанию | Когда менять |
|---|---|---|---|
| Ответ | Потолок длины ответа модели | 16 000 токенов | Модель отвечает отказом на длинный ответ |
| Входной промпт | Потолок на весь промпт целиком | 32 000 токенов | Контекстное окно модели больше или меньше дефолта |
Значение в поле Ответ работает как потолок: ассистент или действие могут запросить меньше, но не больше. Минимум для поля Входной промпт — 1 000 токенов, значения ниже платформа поднимает до минимума. Под полями карточка показывает предупреждение «Убедитесь, что контекстное окно модели не меньше N токенов»: N — сумма обоих лимитов. Оценка консервативная, реально в модель уходит меньше.
Что отбрасывается, когда промпт не помещается
Бюджет входного промпта считается на весь запрос: системная инструкция, история чата, контекст из баз знаний, вложения и стенограммы, сообщение участника и накладные расходы шаблона. Когда запрос не помещается, платформа отбрасывает содержимое в фиксированном порядке — сначала историю чата целыми сообщениями от самых старых, затем вложения, затем фрагменты из баз знаний, и лишь в последнюю очередь обрезает текст сообщения. Системная инструкция сохраняется всегда, а в промпт добавляется пометка об обрезке.
Если провайдер отдаёт токенизатор, платформа считает длину промпта точно и заодно узнаёт реальное контекстное окно модели: окно меньше настройки выигрывает у настройки. Если токенизатора нет, длина оценивается по классам символов, и оценка намеренно завышается — заниженная привела бы к отказу модели уже после того, как часть документа отброшена.
Как настроить тарификацию модели
Цену задаёт секция Тарификация и доступность: сначала выберите Единицу списания, затем
заполните ставки. Для языковых моделей и моделей эмбеддингов выбирайте 1 млн токенов — ставки
в форме заданы за миллион токенов. Вариант 1 тыс. токенов оставлен для ранее заведённых записей
и с полями ставок не связан.
| Поле | Для каких моделей | Что означает |
|---|---|---|
| Единица списания | Все | 1 млн токенов, 1 тыс. токенов или минута |
| Уровень стоимости | Все | Метка для пользователя: Бесплатно, Низкая, Средняя, Высокая, Очень высокая |
| Входные токены | LLM, Embeddings | Кредиты за миллион входных токенов |
| Выходные токены | LLM | Кредиты за миллион выходных токенов |
| Кредиты за минуту | ASR | Кредиты за минуту распознанной речи |
Флажок Бесплатная модель — кредиты за токены не списываются обнуляет ставки и блокирует поля,
у моделей ASR он называется Бесплатная модель — кредиты не списываются. Снятый флажок Модель
активна и доступна в реестре убирает запись из выдачи, не удаляя её. Уровень стоимости — только
подпись рядом с ценой: на расчёт списания он не влияет, списание считается по ставкам.
Как назначить модель по умолчанию для ассистентов
Откройте Администрирование → LLM и сценарии → Политики LLM и OCR, вкладку Ассистенты и чаты, блок Модели ассистентов. В таблице собраны все активные LLM-модели с активным провайдером. Переключатель в первой колонке решает, увидит ли участник модель в настройках ассистента; пункт меню строки Назначить по умолчанию ставит метку По умолчанию. После правок нажмите Сохранить.
Модель по умолчанию работает для системного ассистента Unica Chat и для всех ассистентов, у которых в списке моделей выбран пункт По умолчанию: смена модели в политике переводит их на новую модель без правки каждого ассистента. Сохранить политику без модели по умолчанию платформа не даёт — появляется сообщение «Выберите модель по умолчанию среди доступных моделей».
Отдельной настройки модели для Unica Chat нет: системный ассистент всегда работает на модели по умолчанию.
| Ситуация | Что делает платформа |
|---|---|
| Модель выключена переключателем | Исчезает из списка моделей ассистента |
| Выключена модель, выбранная у ассистента явно | Ассистент переходит в режим По умолчанию |
| Модель по умолчанию удалена или недоступна | Берётся первая доступная активная LLM-модель |
| Активных LLM-моделей с активным провайдером нет | Таблица пуста, ассистенты остаются без модели |
Как настроить Unica Chat, названия чатов и улучшение промптов
Вкладка Ассистенты и чаты, кроме блока Модели ассистентов, содержит ещё три блока — они настраивают сервисные функции платформы. Каждый блок вы сохраняете отдельной кнопкой, а редко используемые поля раскрывает ссылка Расширенные настройки.
| Блок | Что настраивает | Основные поля |
|---|---|---|
| Unica Chat | Поведение системного ассистента | Системный промпт, Температура, Top P |
| Автогенерация названий чатов | Короткое название по первому сообщению | Включить генерацию, Провайдер LLM, Модель, Резервный заголовок |
| Улучшение промптов | Кнопку Улучшить в редакторе ассистента | Включить улучшение, Провайдер LLM, Модель |
В блоках Автогенерация названий чатов и Улучшение промптов значение Наследовать модель по умолчанию в полях Провайдер LLM и Модель означает, что функция работает на модели из блока Модели ассистентов. Отдельный выбор нужен, когда для служебных запросов вы хотите модель дешевле основной.
В расширенных настройках автогенерации вы задаёте инструкцию и шаблон промпта; шаблон обязан содержать
токен {{messageSnippet}}, дополнительно поддерживается {{maxWords}}. Там же вы ограничиваете длину
входа и выхода: Макс. слов из сообщения, Макс. символов из сообщения, Макс. слов в заголовке,
Макс. символов в заголовке. Если генерация выключена, чат получает значение поля Резервный заголовок.
Как ограничить нагрузку на модели и распознавание
Вкладка Производительность (/settings/administration/llm/policies?tab=performance) собирает
ограничители, которыми вы защищаете инсталляцию и внешние сервисы от перегрузки. Блок
Производительность ассистентов управляет очередью действий ассистентов, блок
Производительность OCR — параллелизмом распознавания сканов, общим для чата и баз знаний.
| Параметр | Что делает | По умолчанию | Когда менять |
|---|---|---|---|
| Порядок очереди | Равномерно распределяет места между пространствами, По порядку запускает задачи по времени поступления | Равномерно | Одно пространство занимает всю очередь |
| Задач одновременно | Сколько действий выполняет один сервер | 4 | Сервер недогружен или перегружен |
| На пространство, На ассистента, На пользователя | Потолки очереди для режима Равномерно | 2, 1, 1 | Один источник вытесняет остальных |
| LLM, сек | Сколько ждать один ответ модели | 600 | Модель отвечает дольше таймаута |
| Страниц одного документа | Сколько страниц одного скана распознаётся разом | 2 | Скан обрабатывается слишком долго |
| Документов параллельно | Сколько файлов из очереди импорта идут одновременно | 4 | Очередь импорта не разбирается |
| Глобальный потолок запросов к OCR | Общий потолок одновременных запросов к OCR-модели | 8 | Провайдер отвечает 429 или таймаутами |
Поля На пространство, На ассистента и На пользователя видны только при порядке очереди
Равномерно. Глобальный потолок OCR — главный ограничитель: если он ниже, чем произведение страниц
на документы, реально выполняется столько запросов, сколько задано в нём. Допустимые значения
параллелизма OCR — целые в диапазоне 1–64.
Примечание. Настройка в интерфейсе имеет приоритет над переменной окружения, а переменная — над встроенным значением по умолчанию.
Ссылка Расширенные настройки в блоке Производительность ассистентов раскрывает раздел Таймаут с полем LLM, сек и раздел Если сервер пропал с полями Проверка активности, сек и Перехват задачи, сек: как часто работающий сервер подтверждает, что задача ещё у него, и через сколько секунд молчания её сможет забрать другой сервер. Интервал проверки должен быть меньше срока перехвата, иначе платформа не сохранит настройки.
Частые вопросы
Почему новой модели нет в списке моделей ассистента
Модель попадает в список ассистента только при трёх условиях сразу. Проверьте:
- в карточке модели включён флажок Модель активна и доступна в реестре;
- провайдер модели активен на странице Провайдеры LLM;
- в блоке Модели ассистентов переключатель модели включён и политика сохранена.
Почему платформа не сохраняет модель и требует ключ провайдера
Поле Ключ у провайдера обязательно, как только выбран провайдер, а пара «провайдер + ключ» должна быть уникальной. Проверьте:
- поле Ключ у провайдера заполнено и совпадает с идентификатором в API провайдера;
- такой пары ещё нет у другой записи реестра, в том числе архивной;
- выбран провайдер того же типа, что и модель.
Почему по модели не списываются кредиты
Списание считается по ставкам карточки модели, а не по уровню стоимости. Проверьте:
- флажок Бесплатная модель снят;
- у поля Единица списания выбран
1 млн токенов, а не1 тыс. токенов; - ставки Входные токены и Выходные токены заполнены ненулевыми значениями.
Почему ассистент теряет начало длинного документа
Промпт не помещается в бюджет входного контекста модели, и платформа отбрасывает лишнее. Проверьте:
- значение поля Входной промпт в карточке модели;
- контекстное окно модели у провайдера не меньше суммы обоих лимитов;
- документ передан вложением, а не вставлен в сообщение целиком.
Что дальше
- Провайдеры языковых моделей — подключить провайдера, к которому привязываются модели.
- Провайдеры эмбеддингов — настроить модели для индексации и поиска.
- Первый запуск платформы — порядок настройки инсталляции с нуля.
- Центр активности — посмотреть, как модели отработали в запусках LLM.
- Ассистенты — выбрать модель в настройках ассистента.