Модели и политики

Реестр AI-моделей и политики LLM и OCR — два экрана, которыми вы задаёте, какие модели существуют в инсталляции платформы, сколько стоит их работа в кредитах и с какими ограничениями они работают. Реестр вы ведёте в разделе Администрирование → Платформа → AI-модели (/settings/administration/platform/models), политики — в Администрирование → LLM и сценарии → Политики LLM и OCR (/settings/administration/llm/policies). Модель, которой нет в реестре, недоступна ни ассистенту, ни сценарию (workflow), ни транскрибации, даже если провайдер её отдаёт. Провайдера вы подключаете отдельно — см. Провайдеры языковых моделей.

Что вам понадобится

  • глобальная роль admin: раздел Администрирование открыт только ей;
  • подключённый и активный провайдер нужного типа — языковых моделей, эмбеддингов или ASR;
  • точный идентификатор модели в API провайдера;
  • согласованная с владельцем инсталляции цена модели в кредитах.

Как добавить модель в реестр инсталляции

Откройте Администрирование → Платформа → AI-модели, нажмите Создать модель, заполните форму и нажмите Создать. Платформа сразу добавляет запись в реестр, и модель становится видна везде, где выбирают модель: в настройках ассистента, в узлах сценария, в настройках индексации и поиска.

  1. Заполните секцию Основное: название, ключ модели, описание.
  2. В секции Связка с провайдером выберите Тип модели, затем Провайдер и укажите Ключ у провайдера.
  3. Для типа LLM задайте лимиты токенов в секции Лимиты.
  4. В секции Тарификация и доступность укажите единицу списания и цену.
  5. Нажмите Создать.
ПолеЧто указатьОбязательно
НазваниеКак модель называется в списках интерфейса: GPT-4oДа
Ключ моделиСтабильный внутренний ключ записи: gpt-4oДа
ОписаниеКороткое пояснение для администраторовНет
Тип моделиLLM, Embeddings или ASR — от него зависит список провайдеровДа
ПровайдерПровайдер того же типа; список обновляется при открытииДа
Ключ у провайдераИдентификатор модели в API провайдера: gpt-4o-miniДа

Примечание. Ключ модели платформа использует внутри себя, а Ключ у провайдера уходит в запрос к провайдеру.

Пара «провайдер + ключ у провайдера» уникальна: вторую запись с той же парой платформа не сохранит. Если у провайдера включена синхронизация моделей, привязка может обновиться при следующем импорте.

Список вы фильтруете строкой поиска и фасетами Тип, Провайдер, Статус. Статус Активна означает, что модель доступна для выбора, Архив — что запись сохранена, но скрыта. Перевести запись между статусами можно из меню строки: Архивировать и Восстановить.

Какие лимиты токенов задаёт карточка модели

Секция Лимиты появляется только у моделей типа LLM и содержит два поля — Ответ и Входной промпт. Оба задают потолки для всех ассистентов и действий, которые работают на этой модели.

ПараметрЧто делаетПо умолчаниюКогда менять
ОтветПотолок длины ответа модели16 000 токеновМодель отвечает отказом на длинный ответ
Входной промптПотолок на весь промпт целиком32 000 токеновКонтекстное окно модели больше или меньше дефолта

Значение в поле Ответ работает как потолок: ассистент или действие могут запросить меньше, но не больше. Минимум для поля Входной промпт — 1 000 токенов, значения ниже платформа поднимает до минимума. Под полями карточка показывает предупреждение «Убедитесь, что контекстное окно модели не меньше N токенов»: N — сумма обоих лимитов. Оценка консервативная, реально в модель уходит меньше.

Что отбрасывается, когда промпт не помещается

Бюджет входного промпта считается на весь запрос: системная инструкция, история чата, контекст из баз знаний, вложения и стенограммы, сообщение участника и накладные расходы шаблона. Когда запрос не помещается, платформа отбрасывает содержимое в фиксированном порядке — сначала историю чата целыми сообщениями от самых старых, затем вложения, затем фрагменты из баз знаний, и лишь в последнюю очередь обрезает текст сообщения. Системная инструкция сохраняется всегда, а в промпт добавляется пометка об обрезке.

Если провайдер отдаёт токенизатор, платформа считает длину промпта точно и заодно узнаёт реальное контекстное окно модели: окно меньше настройки выигрывает у настройки. Если токенизатора нет, длина оценивается по классам символов, и оценка намеренно завышается — заниженная привела бы к отказу модели уже после того, как часть документа отброшена.

Карточка LLM-модели: секция «Лимиты» с полями «Ответ» и «Входной промпт» и предупреждением о контекстном окне
Секция «Лимиты» в карточке модели

Как настроить тарификацию модели

Цену задаёт секция Тарификация и доступность: сначала выберите Единицу списания, затем заполните ставки. Для языковых моделей и моделей эмбеддингов выбирайте 1 млн токенов — ставки в форме заданы за миллион токенов. Вариант 1 тыс. токенов оставлен для ранее заведённых записей и с полями ставок не связан.

ПолеДля каких моделейЧто означает
Единица списанияВсе1 млн токенов, 1 тыс. токенов или минута
Уровень стоимостиВсеМетка для пользователя: Бесплатно, Низкая, Средняя, Высокая, Очень высокая
Входные токеныLLM, EmbeddingsКредиты за миллион входных токенов
Выходные токеныLLMКредиты за миллион выходных токенов
Кредиты за минутуASRКредиты за минуту распознанной речи

Флажок Бесплатная модель — кредиты за токены не списываются обнуляет ставки и блокирует поля, у моделей ASR он называется Бесплатная модель — кредиты не списываются. Снятый флажок Модель активна и доступна в реестре убирает запись из выдачи, не удаляя её. Уровень стоимости — только подпись рядом с ценой: на расчёт списания он не влияет, списание считается по ставкам.

Как назначить модель по умолчанию для ассистентов

Откройте Администрирование → LLM и сценарии → Политики LLM и OCR, вкладку Ассистенты и чаты, блок Модели ассистентов. В таблице собраны все активные LLM-модели с активным провайдером. Переключатель в первой колонке решает, увидит ли участник модель в настройках ассистента; пункт меню строки Назначить по умолчанию ставит метку По умолчанию. После правок нажмите Сохранить.

Модель по умолчанию работает для системного ассистента Unica Chat и для всех ассистентов, у которых в списке моделей выбран пункт По умолчанию: смена модели в политике переводит их на новую модель без правки каждого ассистента. Сохранить политику без модели по умолчанию платформа не даёт — появляется сообщение «Выберите модель по умолчанию среди доступных моделей».

Отдельной настройки модели для Unica Chat нет: системный ассистент всегда работает на модели по умолчанию.

СитуацияЧто делает платформа
Модель выключена переключателемИсчезает из списка моделей ассистента
Выключена модель, выбранная у ассистента явноАссистент переходит в режим По умолчанию
Модель по умолчанию удалена или недоступнаБерётся первая доступная активная LLM-модель
Активных LLM-моделей с активным провайдером нетТаблица пуста, ассистенты остаются без модели

Как настроить Unica Chat, названия чатов и улучшение промптов

Вкладка Ассистенты и чаты, кроме блока Модели ассистентов, содержит ещё три блока — они настраивают сервисные функции платформы. Каждый блок вы сохраняете отдельной кнопкой, а редко используемые поля раскрывает ссылка Расширенные настройки.

БлокЧто настраиваетОсновные поля
Unica ChatПоведение системного ассистентаСистемный промпт, Температура, Top P
Автогенерация названий чатовКороткое название по первому сообщениюВключить генерацию, Провайдер LLM, Модель, Резервный заголовок
Улучшение промптовКнопку Улучшить в редакторе ассистентаВключить улучшение, Провайдер LLM, Модель

В блоках Автогенерация названий чатов и Улучшение промптов значение Наследовать модель по умолчанию в полях Провайдер LLM и Модель означает, что функция работает на модели из блока Модели ассистентов. Отдельный выбор нужен, когда для служебных запросов вы хотите модель дешевле основной.

В расширенных настройках автогенерации вы задаёте инструкцию и шаблон промпта; шаблон обязан содержать токен {{messageSnippet}}, дополнительно поддерживается {{maxWords}}. Там же вы ограничиваете длину входа и выхода: Макс. слов из сообщения, Макс. символов из сообщения, Макс. слов в заголовке, Макс. символов в заголовке. Если генерация выключена, чат получает значение поля Резервный заголовок.

Как ограничить нагрузку на модели и распознавание

Вкладка Производительность (/settings/administration/llm/policies?tab=performance) собирает ограничители, которыми вы защищаете инсталляцию и внешние сервисы от перегрузки. Блок Производительность ассистентов управляет очередью действий ассистентов, блок Производительность OCR — параллелизмом распознавания сканов, общим для чата и баз знаний.

ПараметрЧто делаетПо умолчаниюКогда менять
Порядок очередиРавномерно распределяет места между пространствами, По порядку запускает задачи по времени поступленияРавномерноОдно пространство занимает всю очередь
Задач одновременноСколько действий выполняет один сервер4Сервер недогружен или перегружен
На пространство, На ассистента, На пользователяПотолки очереди для режима Равномерно2, 1, 1Один источник вытесняет остальных
LLM, секСколько ждать один ответ модели600Модель отвечает дольше таймаута
Страниц одного документаСколько страниц одного скана распознаётся разом2Скан обрабатывается слишком долго
Документов параллельноСколько файлов из очереди импорта идут одновременно4Очередь импорта не разбирается
Глобальный потолок запросов к OCRОбщий потолок одновременных запросов к OCR-модели8Провайдер отвечает 429 или таймаутами

Поля На пространство, На ассистента и На пользователя видны только при порядке очереди Равномерно. Глобальный потолок OCR — главный ограничитель: если он ниже, чем произведение страниц на документы, реально выполняется столько запросов, сколько задано в нём. Допустимые значения параллелизма OCR — целые в диапазоне 1–64.

Примечание. Настройка в интерфейсе имеет приоритет над переменной окружения, а переменная — над встроенным значением по умолчанию.

Ссылка Расширенные настройки в блоке Производительность ассистентов раскрывает раздел Таймаут с полем LLM, сек и раздел Если сервер пропал с полями Проверка активности, сек и Перехват задачи, сек: как часто работающий сервер подтверждает, что задача ещё у него, и через сколько секунд молчания её сможет забрать другой сервер. Интервал проверки должен быть меньше срока перехвата, иначе платформа не сохранит настройки.

Вкладка «Производительность»: блоки «Производительность ассистентов» и «Производительность OCR» с полями параллелизма
Вкладка «Производительность»: параллелизм ассистентов и OCR

Частые вопросы

Почему новой модели нет в списке моделей ассистента

Модель попадает в список ассистента только при трёх условиях сразу. Проверьте:

  • в карточке модели включён флажок Модель активна и доступна в реестре;
  • провайдер модели активен на странице Провайдеры LLM;
  • в блоке Модели ассистентов переключатель модели включён и политика сохранена.

Почему платформа не сохраняет модель и требует ключ провайдера

Поле Ключ у провайдера обязательно, как только выбран провайдер, а пара «провайдер + ключ» должна быть уникальной. Проверьте:

  • поле Ключ у провайдера заполнено и совпадает с идентификатором в API провайдера;
  • такой пары ещё нет у другой записи реестра, в том числе архивной;
  • выбран провайдер того же типа, что и модель.

Почему по модели не списываются кредиты

Списание считается по ставкам карточки модели, а не по уровню стоимости. Проверьте:

  • флажок Бесплатная модель снят;
  • у поля Единица списания выбран 1 млн токенов, а не 1 тыс. токенов;
  • ставки Входные токены и Выходные токены заполнены ненулевыми значениями.

Почему ассистент теряет начало длинного документа

Промпт не помещается в бюджет входного контекста модели, и платформа отбрасывает лишнее. Проверьте:

  • значение поля Входной промпт в карточке модели;
  • контекстное окно модели у провайдера не меньше суммы обоих лимитов;
  • документ передан вложением, а не вставлен в сообщение целиком.

Что дальше