AI-агенты
Создание и настройка голосовых AI-агентов в Voxagent
AI-агенты — основа Voxagent. Каждый агент — это настраиваемый голосовой ассистент, способный вести разговоры с пользователями в реальном времени.
Настройка агента
Основные параметры
- Название — имя агента (до 50 символов)
- Системный промпт — инструкции, определяющие поведение, личность и знания агента. Поддерживает динамические переменные в формате
{{имя_переменной}} - Temperature — контролирует случайность ответов LLM (0 = детерминированные, 1 = креативные)
- Лимит токенов — максимальное потребление токенов за разговор
Языки и локализация
Каждый агент поддерживает несколько языков. Для каждого языка настраивается:
- Первое сообщение — приветствие, которое агент произносит в начале разговора
- TTS-голос — голос и провайдер синтеза речи
- Скорость речи — множитель скорости воспроизведения
- Фоновый звук — звуковой фон во время разговора (тишина, офис, кофейня и т.д.)
Агент может автоматически определять язык пользователя и переключаться на соответствующую локаль.
LLM-модель
Выбор языковой модели, которая обеспечивает логику агента:
- LLM-провайдер и версия модели
- Temperature и дополнительные параметры модели
Рекомендованные модели для Voice Sales
Рейтинг лучших LLM для сценариев исходящих голосовых продаж — по критериям latency, качества русского языка и надёжности вызова инструментов.
Загрузка моделей…
Ключевые факторы для voice:
- Latency (TTFT) — время до первого токена напрямую влияет на воспринимаемую скорость ответа; модели с reasoning (chain-of-thought) добавляют 300–800 мс
- Качество русского — Qwen3 и GLM-4.7 обучены на больших кириллических корпусах
- Управляемость — насколько точно модель следует персоне, скриптам отработки возражений и схемам tool-call, не добавляя лишних шагов
Подробный разбор моделей
🥇 Qwen3-30B-A3B (DeepInfra) — MoE-флагман среднего класса от Alibaba: 30.5B параметров с 3.3B активных за токен (8 из 128 экспертов), unified thinking/non-thinking режим (для voice используем non-thinking). В коротких репликах ведёт себя сдержанно, не сбивается в маркетинговый тон, чётко исполняет инструкции из system prompt (на independent IFEval ≈ 84.7%), уверенно вызывает tool'ы по схеме (BFCL v3 ≈ 65.1). Сильный русский — модель обучена на больших кириллических корпусах, не «соскальзывает» в английский даже когда клиент задаёт смешанные фразы. Хорошо держит диалог в роли менеджера: короткие фразы, один вопрос за раз, мало отступлений. Для Voice Sales — оптимальный baseline по соотношению качество/предсказуемость поведения.
Источники: Qwen3 technical report (arXiv 2505.09388), HuggingFace model card, BFCL v3 leaderboard.
🥈 GLM-4.7 non-reasoning (Cerebras) — agent-флагман от Zhipu AI / Z.ai, хостится на чип-инфре Cerebras. По τ-bench (multi-turn agentic tasks: бронирование, retail-сценарии) даёт ≈ 87.4% — один из лучших результатов среди open-weight моделей такого класса. В разговоре «инженерно-вежливый»: чётко закрывает шаги, аккуратно подтверждает услышанное, охотно вызывает tool'ы (parallel + single tool-calling из коробки). Важно: строго в non-reasoning режиме — thinking-блоки нелогично распухают на коротких репликах и режут latency. По русскому слабее Qwen3 (заметнее калька с английских конструкций), но если разговор скриптованный — справляется.
Источники: Cerebras GLM-4.7 announcement, Cerebras inference docs, τ-bench paper (arXiv 2406.12045).
🥉 Gemini 3.1 Flash Lite (Google AI Studio) — managed Google-модель с контекстом 1M токенов и поддержкой мультимодальности (text/image/audio/video). Подкупает предсказуемостью: меньше сюрпризов open-weight моделей, стабильная грамматика на русском, ровная tone-of-voice. Tool-calling работает через structured outputs (без отдельной BFCL-сертификации). Используется как managed-fallback: когда нужно гарантированно работающее SLO без своей инфры — отдаёт ровный результат, но в сравнении с Qwen3/GLM-4.7 проигрывает по богатству тонкого следования персоне и по сложности агентного поведения.
Источники: Google model card, Google Cloud blog.
4. Nemotron Super 49B (DeepInfra) — dense 49B-модель (NAS-сжатие с Llama-3.3-70B через NVIDIA «Puzzle»-алгоритм), 128K контекст, post-trained для reasoning, tool-calling и RAG. В разговоре звучит «академично-развёрнуто»: любит подробно проговаривать ход мысли, делает явные reasoning-шаги, что противоречит инструкции "одна короткая реплика" Voice Sales-сценария. Хорошо подходит для агентов где качество вывода важнее скорости (анализ длинных диалогов, итоговая саммаризация звонка, сложная фильтрация tool-результатов). Для короткой реплики менеджера — избыточна.
Источники: NVIDIA Nemotron model card, NVIDIA build page.
Резервные (fallback) LLM-модели
Под основным LLM-пикером в настройках агента можно добавить до двух резервных моделей. Каждая строка — отдельная модель + версия, и список упорядоченный: runtime идёт сверху вниз и использует первую модель, которая успешно ответила.
Когда срабатывает резерв. Fallback запускается только если предыдущая модель упала — недоступность провайдера, rate-limit / квота, network timeout, ошибка ключа. Успешный ответ (даже медленный) fallback не триггерит — отдаём то, что вернула активная модель.
Почему порядок важен.
- Основная модель работает на каждом ходу. Ставьте сюда ту, чьё звучание и tool-calling вы реально хотите слышать на звонках.
- Fallback #1 — на самый вероятный сбой основной. Если primary хостится на Cerebras — fallback #1 разумно взять с DeepInfra (другой инференс-провайдер, похожее поведение): тональность диалога не уплывёт.
- Fallback #2 — «во что бы то ни стало». Сюда хорошо ложится managed-модель Google / OpenAI: совсем другой вендор, предсказуемый русский, минимум риска что мульти-провайдерный outage положит агента целиком.
Промпт / персону между попытками мы не меняем — та же история диалога просто проигрывается следующей модели. Выбирайте резервы так, чтобы стиль ответа был достаточно близок к основному и абонент не заметил подмены посреди реплики.
Поведение в UI.
- В пикере каждой строки скрыты модели, уже выбранные на этом агенте (primary или другая fallback-строка) — задублировать цепочку случайно нельзя.
- Перетаскивайте ручку слева от строки (
☰), чтобы сменить приоритет. Порядок в UI = порядок попыток. - Кнопка «Select this version» внутри тестера модели прокидывает версию прямо в ту строку, из которой вы открыли тестер.
- Иконка корзины справа удаляет резервную строку. Можно удалить все — тогда у агента просто нет резервов и при падении primary ход проваливается.
Нюансы.
- Каждый fallback добавляет latency на пути сбоя (мы ждём пока primary упадёт прежде чем дёргать следующий). Не пихайте сюда много моделей в надежде замаскировать нестабильность — лучше починить primary.
- Токены и биллинг считаются по той модели, что фактически ответила, а не по primary.
- Если fallback-версия снята с производства провайдером, строка остаётся с оранжевым ⚠️ — замените её на актуальную.
Распознавание речи (STT)
Настройка транскрибации речи пользователя:
- Модель и STT-провайдер
- Параметры, специфичные для модели
Детекция голосовой активности (VAD)
Управление детекцией речи пользователя:
- Выбор модели VAD
- Параметры чувствительности и таймингов
- Возможность отключить прерывания во время первого сообщения
Голос (TTS)
Настройка голоса агента для каждого языка:
- TTS-провайдер
- Выбор голоса и его параметры
- Регулировка скорости
- Тип и громкость фонового звука
Динамические переменные
Агенты поддерживают динамические переменные в системных промптах и первых сообщениях. Переменные задаются через OpenAPI-схему и подставляются при запуске.
Пример системного промпта:
Ты агент поддержки компании {{company_name}}.
Имя клиента — {{customer_name}}, номер заказа — {{order_id}}.Переменные передаются через:
- API-вызов при диспатче
- URL-параметры (для виджета)
- Данные элемента кампании (для исходящих звонков)
Каждая переменная имеет:
- Имя
- Тип (string, number, boolean, integer)
- Описание
- Значение по умолчанию
- Флаг nullable
Инструменты агента
Агенты могут вызывать внешние API во время разговора. Подробнее в разделе Инструменты и интеграции.
Публикация
Агент может быть опубликован для предоставления доступа:
- Опубликованный агент — доступен по публичной ссылке для тестирования
- Виджет — встраивается на любой сайт
- Номер телефона — привязывается к входящей/исходящей телефонии
- API — запускается программно
Дублирование агента
Любой агент можно продублировать, создав копию со всеми настройками. Полезно для создания вариаций или шаблонов.