AI-агенты

Создание и настройка голосовых AI-агентов в Voxagent

AI-агенты — основа Voxagent. Каждый агент — это настраиваемый голосовой ассистент, способный вести разговоры с пользователями в реальном времени.

Настройка агента

Основные параметры

  • Название — имя агента (до 50 символов)
  • Системный промпт — инструкции, определяющие поведение, личность и знания агента. Поддерживает динамические переменные в формате {{имя_переменной}}
  • Temperature — контролирует случайность ответов LLM (0 = детерминированные, 1 = креативные)
  • Лимит токенов — максимальное потребление токенов за разговор

Языки и локализация

Каждый агент поддерживает несколько языков. Для каждого языка настраивается:

  • Первое сообщение — приветствие, которое агент произносит в начале разговора
  • TTS-голос — голос и провайдер синтеза речи
  • Скорость речи — множитель скорости воспроизведения
  • Фоновый звук — звуковой фон во время разговора (тишина, офис, кофейня и т.д.)

Агент может автоматически определять язык пользователя и переключаться на соответствующую локаль.

LLM-модель

Выбор языковой модели, которая обеспечивает логику агента:

  • LLM-провайдер и версия модели
  • Temperature и дополнительные параметры модели

Рекомендованные модели для Voice Sales

Рейтинг лучших LLM для сценариев исходящих голосовых продаж — по критериям latency, качества русского языка и надёжности вызова инструментов.

Загрузка моделей…

Ключевые факторы для voice:

  • Latency (TTFT) — время до первого токена напрямую влияет на воспринимаемую скорость ответа; модели с reasoning (chain-of-thought) добавляют 300–800 мс
  • Качество русского — Qwen3 и GLM-4.7 обучены на больших кириллических корпусах
  • Управляемость — насколько точно модель следует персоне, скриптам отработки возражений и схемам tool-call, не добавляя лишних шагов
Подробный разбор моделей

🥇 Qwen3-30B-A3B (DeepInfra) — MoE-флагман среднего класса от Alibaba: 30.5B параметров с 3.3B активных за токен (8 из 128 экспертов), unified thinking/non-thinking режим (для voice используем non-thinking). В коротких репликах ведёт себя сдержанно, не сбивается в маркетинговый тон, чётко исполняет инструкции из system prompt (на independent IFEval ≈ 84.7%), уверенно вызывает tool'ы по схеме (BFCL v3 ≈ 65.1). Сильный русский — модель обучена на больших кириллических корпусах, не «соскальзывает» в английский даже когда клиент задаёт смешанные фразы. Хорошо держит диалог в роли менеджера: короткие фразы, один вопрос за раз, мало отступлений. Для Voice Sales — оптимальный baseline по соотношению качество/предсказуемость поведения.
Источники: Qwen3 technical report (arXiv 2505.09388), HuggingFace model card, BFCL v3 leaderboard.

🥈 GLM-4.7 non-reasoning (Cerebras) — agent-флагман от Zhipu AI / Z.ai, хостится на чип-инфре Cerebras. По τ-bench (multi-turn agentic tasks: бронирование, retail-сценарии) даёт ≈ 87.4% — один из лучших результатов среди open-weight моделей такого класса. В разговоре «инженерно-вежливый»: чётко закрывает шаги, аккуратно подтверждает услышанное, охотно вызывает tool'ы (parallel + single tool-calling из коробки). Важно: строго в non-reasoning режиме — thinking-блоки нелогично распухают на коротких репликах и режут latency. По русскому слабее Qwen3 (заметнее калька с английских конструкций), но если разговор скриптованный — справляется.
Источники: Cerebras GLM-4.7 announcement, Cerebras inference docs, τ-bench paper (arXiv 2406.12045).

🥉 Gemini 3.1 Flash Lite (Google AI Studio) — managed Google-модель с контекстом 1M токенов и поддержкой мультимодальности (text/image/audio/video). Подкупает предсказуемостью: меньше сюрпризов open-weight моделей, стабильная грамматика на русском, ровная tone-of-voice. Tool-calling работает через structured outputs (без отдельной BFCL-сертификации). Используется как managed-fallback: когда нужно гарантированно работающее SLO без своей инфры — отдаёт ровный результат, но в сравнении с Qwen3/GLM-4.7 проигрывает по богатству тонкого следования персоне и по сложности агентного поведения.
Источники: Google model card, Google Cloud blog.

4. Nemotron Super 49B (DeepInfra) — dense 49B-модель (NAS-сжатие с Llama-3.3-70B через NVIDIA «Puzzle»-алгоритм), 128K контекст, post-trained для reasoning, tool-calling и RAG. В разговоре звучит «академично-развёрнуто»: любит подробно проговаривать ход мысли, делает явные reasoning-шаги, что противоречит инструкции "одна короткая реплика" Voice Sales-сценария. Хорошо подходит для агентов где качество вывода важнее скорости (анализ длинных диалогов, итоговая саммаризация звонка, сложная фильтрация tool-результатов). Для короткой реплики менеджера — избыточна.
Источники: NVIDIA Nemotron model card, NVIDIA build page.

Резервные (fallback) LLM-модели

Под основным LLM-пикером в настройках агента можно добавить до двух резервных моделей. Каждая строка — отдельная модель + версия, и список упорядоченный: runtime идёт сверху вниз и использует первую модель, которая успешно ответила.

Когда срабатывает резерв. Fallback запускается только если предыдущая модель упала — недоступность провайдера, rate-limit / квота, network timeout, ошибка ключа. Успешный ответ (даже медленный) fallback не триггерит — отдаём то, что вернула активная модель.

Почему порядок важен.

  • Основная модель работает на каждом ходу. Ставьте сюда ту, чьё звучание и tool-calling вы реально хотите слышать на звонках.
  • Fallback #1 — на самый вероятный сбой основной. Если primary хостится на Cerebras — fallback #1 разумно взять с DeepInfra (другой инференс-провайдер, похожее поведение): тональность диалога не уплывёт.
  • Fallback #2 — «во что бы то ни стало». Сюда хорошо ложится managed-модель Google / OpenAI: совсем другой вендор, предсказуемый русский, минимум риска что мульти-провайдерный outage положит агента целиком.

Промпт / персону между попытками мы не меняем — та же история диалога просто проигрывается следующей модели. Выбирайте резервы так, чтобы стиль ответа был достаточно близок к основному и абонент не заметил подмены посреди реплики.

Поведение в UI.

  • В пикере каждой строки скрыты модели, уже выбранные на этом агенте (primary или другая fallback-строка) — задублировать цепочку случайно нельзя.
  • Перетаскивайте ручку слева от строки (), чтобы сменить приоритет. Порядок в UI = порядок попыток.
  • Кнопка «Select this version» внутри тестера модели прокидывает версию прямо в ту строку, из которой вы открыли тестер.
  • Иконка корзины справа удаляет резервную строку. Можно удалить все — тогда у агента просто нет резервов и при падении primary ход проваливается.

Нюансы.

  • Каждый fallback добавляет latency на пути сбоя (мы ждём пока primary упадёт прежде чем дёргать следующий). Не пихайте сюда много моделей в надежде замаскировать нестабильность — лучше починить primary.
  • Токены и биллинг считаются по той модели, что фактически ответила, а не по primary.
  • Если fallback-версия снята с производства провайдером, строка остаётся с оранжевым ⚠️ — замените её на актуальную.

Распознавание речи (STT)

Настройка транскрибации речи пользователя:

  • Модель и STT-провайдер
  • Параметры, специфичные для модели

Детекция голосовой активности (VAD)

Управление детекцией речи пользователя:

  • Выбор модели VAD
  • Параметры чувствительности и таймингов
  • Возможность отключить прерывания во время первого сообщения

Голос (TTS)

Настройка голоса агента для каждого языка:

  • TTS-провайдер
  • Выбор голоса и его параметры
  • Регулировка скорости
  • Тип и громкость фонового звука

Динамические переменные

Агенты поддерживают динамические переменные в системных промптах и первых сообщениях. Переменные задаются через OpenAPI-схему и подставляются при запуске.

Пример системного промпта:

Ты агент поддержки компании {{company_name}}.
Имя клиента — {{customer_name}}, номер заказа — {{order_id}}.

Переменные передаются через:

  • API-вызов при диспатче
  • URL-параметры (для виджета)
  • Данные элемента кампании (для исходящих звонков)

Каждая переменная имеет:

  • Имя
  • Тип (string, number, boolean, integer)
  • Описание
  • Значение по умолчанию
  • Флаг nullable

Инструменты агента

Агенты могут вызывать внешние API во время разговора. Подробнее в разделе Инструменты и интеграции.

Публикация

Агент может быть опубликован для предоставления доступа:

  • Опубликованный агент — доступен по публичной ссылке для тестирования
  • Виджет — встраивается на любой сайт
  • Номер телефона — привязывается к входящей/исходящей телефонии
  • API — запускается программно

Дублирование агента

Любой агент можно продублировать, создав копию со всеми настройками. Полезно для создания вариаций или шаблонов.

Содержание