Создание и настройка агентов

Пошаговое создание и настройка голосового AI-агента в Voxagent

Агент — это голосовой AI-ассистент, который ведёт разговоры с пользователями. В этом разделе описано, как создать и настроить агента в Voxagent.

Создание агента

  1. Откройте https://console.voxagent.ru и перейдите в раздел Agents
  2. Нажмите Create Agent
  3. Введите название агента (до 50 символов)
  4. Агент будет создан с настройками по умолчанию — далее вы можете их изменить

Режим работы агента

До настройки остальных секций выберите режим, в котором агент обрабатывает голос. От режима зависит, какие вкладки будут видны и как строится голосовой конвейер во время разговора.

Переключатель Agent Mode находится в верхней части страницы настройки агента. Доступны два режима:

Classic (классический)

Классический конвейер STT → LLM → TTS. Речь пользователя распознаётся в текст, LLM генерирует текстовый ответ, TTS озвучивает его голосом.

  • Отдельно настраиваются LLM, STT, VAD и голос TTS для каждого языка.
  • Можно комбинировать провайдеров (например, Deepgram STT + GPT-4o + ElevenLabs TTS).
  • Больше гибкости и больше движущихся частей.
  • Режим по умолчанию для новых агентов.

Realtime (voice-to-voice)

Единая аудио-нативная модель слушает, рассуждает и говорит в рамках одной WebSocket-сессии — без отдельных стадий STT/LLM/TTS.

  • Выбираются одна Realtime-модель и один голос на каждый язык — и всё.
  • Секции STT, VAD и TTS скрыты — модель делает всё сама.
  • Меньше компонентов, ниже задержка, естественнее интонации.
  • Цепочка fallback для Realtime временно скрыта — семантика fallback для voice-to-voice ещё уточняется.

Доступные провайдеры Realtime:

ПровайдерМоделиПримечания
OpenAIgpt-realtime, gpt-4o-realtime-preview, gpt-4o-mini-realtime-previewВключает эксклюзивные голоса marin и cedar, доступные только через Realtime API
Google AI Studiogemini-2.5-native-audio-dialogПоддерживает affective dialog — более эмоциональная подача

Когда выбирать Realtime

Realtime подходит, когда важнее задержка и естественность речи, чем тонкая настройка каждой стадии конвейера. Classic — когда нужно смешивать лучших поставщиков (например, специализированный STT под конкретный язык) или использовать fallback между LLM.

Смена режима

Переключение агента между Classic и Realtime сбрасывает настройки тех секций, которые меняют видимость. После смены режима опубликуйте новую версию агента.

Системный промпт

Системный промпт — главная инструкция, определяющая поведение, личность и знания агента.

  1. На странице агента откройте вкладку General
  2. Введите текст системного промпта в поле System Prompt
  3. Используйте динамические переменные в формате {{имя_переменной}} для подстановки данных при запуске

Рекомендация

Структурируйте промпт с заголовками: # Личность, # Цель, # Ограничения, # Тон. Подробнее — в разделе Руководство по промптингу.

Пример:

# Личность
Ты — приветливый оператор поддержки компании {{company_name}}.

# Цель
Помоги клиенту {{customer_name}} решить вопрос по заказу {{order_id}}.

# Ограничения
- Не обсуждай конкурентов
- Не давай финансовых советов

Выбор LLM-модели

Языковая модель определяет «мозг» агента — качество рассуждений, скорость ответа и стоимость.

  1. На вкладке LLM выберите LLM-провайдера
  2. Выберите конкретную модель
  3. Настройте параметры модели при необходимости

Температура

Параметр Temperature контролирует степень случайности в ответах:

ЗначениеПоведение
0.0Детерминированные, предсказуемые ответы
0.3–0.5Баланс предсказуемости и естественности
0.7–1.0Более творческие, разнообразные ответы

Для голосовых агентов

Рекомендуется значение 0.3–0.6. Слишком высокая температура делает ответы непредсказуемыми, что плохо для деловых сценариев.

Языки и первые сообщения

Агент может поддерживать несколько языков. Для каждого языка настраивается отдельное приветствие.

  1. На вкладке Languages нажмите Add Language
  2. Выберите язык из списка
  3. Введите First Message — приветствие, которое агент произносит в начале разговора
  4. Первое сообщение поддерживает динамические переменные: {{customer_name}}

Пример первого сообщения:

Здравствуйте, {{customer_name}}! Меня зовут Анна, я оператор поддержки.
Чем могу помочь?

Несколько языков

Если агент поддерживает несколько языков, он может автоматически определять язык пользователя и переключаться на соответствующую локаль.

Настройка TTS-голоса

Для каждого языка настраивается голос синтеза речи.

  1. В настройках языка выберите TTS Provider
  2. Выберите конкретный голос из каталога провайдера
  3. Настройте дополнительные параметры:

Скорость речи

Множитель скорости воспроизведения. Значение 1.0 — нормальная скорость, 0.9 — чуть медленнее, 1.1 — чуть быстрее.

Фоновый звук

Добавляет звуковой фон во время разговора для создания эффекта присутствия:

  • Тишина — без фона (по умолчанию)
  • Офис — звуки офисного пространства
  • Кофейня — фоновый шум кафе
  • И другие варианты

Фоновый звук

Фоновый звук доступен не для всех провайдеров TTS. Убедитесь, что выбранный провайдер поддерживает эту функцию.

Распознавание речи (STT)

Настройка того, как платформа распознаёт речь пользователя.

  1. На вкладке STT выберите STT-провайдера
  2. Выберите модель распознавания
  3. Настройте параметры, специфичные для модели

Детекция голосовой активности (VAD)

VAD определяет, когда пользователь начинает и заканчивает говорить. Это влияет на поведение очерёдности в разговоре.

  1. На вкладке VAD выберите модель
  2. Настройте параметры чувствительности и таймингов
  3. При необходимости включите опцию Disable interruptions during first message — агент не будет прерываться, пока произносит приветствие

Инструменты

Инструменты позволяют агенту вызывать внешние API во время разговора.

  1. На вкладке Tools нажмите Add Tool
  2. Выберите существующий инструмент из списка или создайте новый
  3. Привязанные инструменты будут доступны агенту во время разговора

Подробнее о создании инструментов — в разделе Инструменты.

Публикация агента

Чтобы агент стал доступен пользователям, его необходимо опубликовать.

  1. На странице агента нажмите переключатель Published
  2. После публикации агент получает:
    • Публичную ссылку для тестирования в браузере
    • Возможность встраивания через виджет
    • Возможность привязки к номеру телефона
    • Доступ через API

Черновик

Неопубликованный агент доступен только для тестирования внутри платформы. Внешние пользователи не смогут к нему подключиться.

Дублирование агента

Для создания копии агента со всеми настройками нажмите Duplicate на странице агента. Это удобно для создания вариаций или шаблонов.

Содержание