Голосовые ИИ-агенты для бизнеса: руководство по пилоту в реальной эксплуатации
Определите, подходит ли вам пилот голосового ИИ-агента, а до масштабирования выберите архитектуру, допустимую задержку, инструменты, правила согласия, эскалацию, оценку и модель затрат.
Dali
Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.
David Hakobyan · LinkedIn · Dali
На этой странице
- Когда голосовой пилот уместен
- Архитектура: сквозная обработка речи или последовательная цепочка
- Таблица решений по процессам
- Задержка, смена реплик, перебивание и расшифровка
- Идентификация, инструменты и права
- Купить, собрать или привлечь партнёра по внедрению
- Запись, согласие и правила исходящих звонков
- Передача человеку, резервный путь и тёплый перевод
- Наблюдаемость и измерение пилота
- Режимы сбоев
- Частые вопросы
- Следующий шаг с Dali
Голосовой ИИ-агент для бизнеса подходит для первого пилота, когда один частый телефонный процесс имеет узкие границы, достаточно обратим для безопасного контроля и уже выполняется людьми по понятным критериям успеха.
Это плохой первый проект, если настоящая проблема состоит в отсутствии регламентов, хаотичных календарях, неясной идентификации или желании «заменить контактный центр» без измерений.
Готовность голоса к реальной эксплуатации означает больше, чем естественно звучащая демонстрация. Она требует выбранной аудиоархитектуры, управления очередностью реплик и перебиваниями, ограниченных инструментов, правил идентификации, политики записи и согласия, передачи человеку, резервного пути при сбое системы и плана оценки до роста трафика.
Голосовые агенты не заменяют команду контактного центра. В лучшем случае они берут определённый срез рутины, готовят контекст для людей и чисто эскалируют, когда кейс выходит за политику.
Если сначала нужно определить агента для реальной эксплуатации без привязки к каналу, начните со статей что такое ИИ-агент для реальной эксплуатации и ИИ-агенты для бизнеса в реальной эксплуатации. Эта статья посвящена устройству и контролю именно голосового пилота.
Когда голосовой пилот уместен
Рекомендация: стартуйте только когда верно всё перечисленное.
- Вы можете описать один процесс от начала до конца, например входящие вопросы о часах работы и маршрутизацию, приём записи только с подтверждением, проверку статуса заказа или ответы на частые вопросы после визита.
- Процесс уже выполняется людьми, даже если пока он описан неполно и работает нестабильно.
- Для неверных ответов предусмотрен понятный путь восстановления, например перенос записи, проверка возврата или обратный звонок руководителя.
- Вы можете записывать или восстанавливать реплики для проверки, не создавая программу соответствия требованиям в день запуска.
- Назначен ответственный за задержки, смену модели или системных инструкций и инциденты поставщика.
Подождите или выберите другой канал, когда:
- звонок в основном про переговоры, кризис, медицинское суждение или юридическое обязательство;
- системы учёта, включая календарь, CRM и остатки, недостоверны;
- никто не будет разбирать транскрипты или тёплые переводы;
- исходящие звонки - первая идея, а согласие не решено.
Текстовые каналы часто лучше для асинхронной работы. См. правила для каналов WhatsApp, Slack и электронной почты и когда ИИ-агентов ещё не стоит использовать.
Сначала составьте карту процесса, а затем выбирайте поставщика голосовой системы. Метод из статьи как составить карту рабочих процессов для ИИ-агентов остаётся применимым: опишите шаги, инструменты, цену ошибки и точки обязательного согласования человеком.
Архитектура: сквозная обработка речи или последовательная цепочка
Документация основных платформ описывает две полноценные архитектуры голосовых систем (OpenAI voice agents).
| Архитектура | Как работает | Когда подходит лучше | Компромисс |
|---|---|---|---|
| Сквозной голосовой сеанс | Модель принимает и выдаёт звук в рамках сеанса реального времени | Естественная смена реплик, перебивание, небольшая задержка до начала ответа и использование инструментов в реальном времени | Промежуточный текст менее заметен; проверка правил и надёжное хранение расшифровок требуют отдельного проектирования |
| Цепочка STT → текстовый агент → TTS | Приложение управляет распознаванием, рассуждением и синтезом речи как отдельными этапами | Процессы с серьёзными согласованиями, заменяемые STT и TTS, более полный аудит промежуточных этапов | Дополнительные переходы могут увеличить задержку; смену реплик нужно настраивать между компонентами |
Руководство OpenAI предлагает сквозную обработку речи как обычную отправную точку, когда взаимодействие должно быть естественным и мгновенным, включая перебивание и инструменты реального времени. Последовательная цепочка подходит лучше, когда нужен явный контроль промежуточного текста, повторное использование существующего текстового агента или надёжно отделённые этапы.
Документация Deepgram Voice Agent похожим образом описывает цепочку, которая объединяет прослушивание, рассуждение и речь, но позволяет настраивать STT, LLM, TTS, определение конца реплики и формат звука (Deepgram Voice Agent).
Рекомендация: выбирайте архитектуру прежде всего по требованиям к контролю и проверке, а не по эффектности демонстрации. Многие команды используют сквозную обработку речи ради естественного разговора, но всё равно выполняют действия с бизнес-последствиями через серверный слой инструментов со строгими списками разрешений.
Сеансы реального времени держат соединение открытым для звука, событий, вызовов инструментов и состояния сеанса (OpenAI Realtime). Это инфраструктура, а не готовая бизнес-система.
Голосовой агент для реальной эксплуатации работает в замкнутом контуре управления: принимает звук, понимает реплику, принимает решение в рамках правил, действует только разрешёнными инструментами, отвечает голосом, а затем передаёт разговор человеку или сохраняет данные для проверки. Если какой-то блок отсутствует, считайте систему демо.
Таблица решений по процессам
Таблица ниже представляет собой рекомендуемую отправную точку, а не стандарт зрелости или отчёт о результатах клиентов. Определяйте степень автономности по цене ошибки, обратимости и возможности обнаружить сбой.
| Тип процесса | Начальная автономность | Нужные инструменты | Передача человеку | Доказательства оценки |
|---|---|---|---|---|
| Входящие вопросы о часах работы, расположении и частые вопросы | Отвечать только по утверждённым знаниям; не выполнять действий с последствиями | Поиск по базе знаний, правила часов работы | Передавать человеку, когда источник отсутствует, противоречив или звонящий настаивает на разговоре с сотрудником | Доля подтверждённых ответов, корректность ссылок на источники, доля обязательных передач человеку |
| Приём записи со сбором данных и предложением | Собрать предпочтения по времени; запись подтверждает человек или система | Чтение календаря, поля квалификации, черновая заметка в CRM | Человек подтверждает запись, отмену или перенос, либо разрешает запись через контрольную точку | Случаи двойной записи, доля пропущенных полей, время до подтверждения |
| Статус заказа или заявки | Поиск только для чтения после проверки личности | Метод идентификации, API заказа или заявки только для чтения | Передавать человеку при несовпадении, нескольких результатах или признаках риска для учётной записи | Доля неудачной идентификации, точность поиска, случаи устаревших данных |
| Квалификация входящих обращений | Задавать структурированные вопросы; создавать потенциального клиента в CRM; не давать исходящих обещаний | Создание и обновление в CRM с ограниченными правами, правила маршрутизации | Передавать готовые к продаже обращения с полным пакетом контекста | Полнота полей, доля неподходящих обращений, принятие передачи |
| Обсуждение платежа или возврата | Только готовить объяснение; никогда не перемещать деньги | Документы правил, чтение учётной записи | Человек одобряет любое начисление, возврат или изменение плана | Заблокированные попытки неразрешённых действий, отклонённые согласования, число инцидентов |
| Исходящее напоминание или уведомление, если это законно | Строгий сценарий и вызовы инструментов; остановка при любом возражении | Реестр согласий, чтение календаря и CRM, управление набором номера | Немедленная передача человеку или обратный звонок при жалобе или сложном ответе | Наличие доказательств согласия, обработка отказов, доля жалоб |
| Тёплая передача после частичного решения | Агент собирает контекст и соединяет с сотрудником | Очередь или перевод в телефонии, запись заметки по обращению | Человек отвечает за оставшуюся часть решения | Полнота пакета передачи, доля возвратов к агенту, время до речи сотрудника |
Гипотетический пример: клиника с несколькими филиалами может пилотировать приём записи с чтением календаря и подтверждением человеком до любой записи, а не с полной автоматической записью ко всем специалистам.
О текстовой поддержке, которая позднее сможет использовать общие знания и точки контроля с голосовым каналом, читайте в статье сценарии ИИ-агентов для клиентской поддержки.
Задержка, смена реплик, перебивание и расшифровка
Задержка
Голос ощущается сломанным, когда тишина тянется после того, как звонящий закончил мысль. Основные руководства платформ подчёркивают важность короткой задержки до начала звукового ответа в разговорных сеансах и советуют балансировать глубину рассуждения со скоростью реакции: OpenAI документирует настраиваемые уровни рассуждения, причём низкий уровень используется по умолчанию во многих голосовых сценариях реального времени (OpenAI voice models announcement).
Рекомендация: измеряйте в своей системе полное время от конца речи пользователя до первого слышимого ответа агента на реальных телефонных и браузерных маршрутах. Не превращайте чужую маркетинговую цель в миллисекундах в свой стандарт. Также измеряйте ожидание вызова инструмента: если агент ищет запись, он должен сообщить об этом и допускать перебивание там, где это безопасно.
Смена реплик и перебивание
Определение границ реплики устанавливает, когда пользователь закончил говорить и когда речь во время ответа должна остановить агента (LiveKit turns overview). Платформы предлагают разные режимы: определение конца реплики моделью, серверный VAD для моделей реального времени, только VAD, определение конца речи средствами STT или ручной режим «нажми и говори».
Возможность перебить агента нужна обязательно. LiveKit документирует остановку речи агента при начале речи пользователя, обрезку истории до реально услышанного, адаптивное различение настоящих перебиваний и коротких подтверждающих звуков, а также настраиваемое восстановление после ложных перебиваний. Google Dialogflow CX документирует перебивание, чтобы звонящий мог остановить звуковой ответ: агент прекращает отправлять звук и обрабатывает следующую реплику (Dialogflow CX advanced speech).
Рекомендация для пилотов:
- включайте перебивание для разговорных ответов на частые вопросы и первичного сбора данных;
- осторожно настраивайте определение конца реплики для шумного телефонного звука: LiveKit отмечает более высокие пороги VAD как подход для телефонии на шумных линиях;
- определите поведение при перебивании во время вызова инструмента: отменить, завершить в фоне или продолжить позднее;
- журналируйте события перебивания, чтобы исправлять ложные обрывы.
Расшифровка
Даже системам со сквозной обработкой речи обычно нужна расшифровка для проверки качества и заметок в CRM. Последовательные цепочки делают расшифровку полноценным отдельным этапом. Системам со сквозной обработкой речи по той же причине нужен явный способ её сохранения.
Рекомендация: храните очищенную от чувствительных данных расшифровку, показатели уверенности или неопределённости, если они доступны, язык и отметки времени, сопоставленные с вызовами инструментов. Не считайте расшифровку юридически достоверной записью без правил хранения и доступа.
Идентификация, инструменты и права
Голосовой агент, который может «делать всё, что доступно сотруднику поддержки», не готов к реальной эксплуатации.
Базовые рекомендации для агентов остаются применимыми: нужны модели, инструменты и инструкции, а также вмешательство человека после достижения порогов сбоя и до действий с высоким риском (OpenAI practical guide to building agents). Документация голосовых агентов так же явно предусматривает инструменты, передачу задач, защитные ограничения и проверку человеком, как и документация текстовых агентов (OpenAI voice agents, guardrails and human review).
Рекомендация:
- проверяйте личность до ответов по конкретной учётной записи: одного номера звонящего недостаточно для действий с высоким риском;
- используйте минимально необходимые области прав инструментов и списки разрешений (безопасные вызовы инструментов для бизнес-агентов);
- разделяйте инструменты чтения и записи;
- требуйте согласования человеком для перемещения денег, юридических обязательств, восстановления после захвата учётной записи и необратимой отмены (ИИ-агенты с участием человека);
- дайте агенту отдельную машинную идентичность с ротацией данных доступа, аудитом и аварийным отключением, а не общий пароль сотрудника.
Использование инструментов во время разговора должно оставаться понятным, когда возникает ожидание. В материалах OpenAI о голосовых продуктах реального времени описаны параллельные вызовы инструментов и слышимые сообщения о состоянии, например уведомление о проверке календаря во время выполнения (OpenAI voice models announcement). Считайте это принципом взаимодействия, а не доказательством качественной реализации у каждого поставщика.
Купить, собрать или привлечь партнёра по внедрению
Выбирайте управляемый голосовой продукт, когда процесс укладывается в штатные интеграции, модель согласования, управление расшифровками и правила передачи человеку без собственной системы координации. Часто это самый быстрый вариант для узкого пилота виртуального администратора, маршрутизации или ответов на частые вопросы, где платформа уже предоставляет нужные телефонные пути и интеграции с CRM.
Создавайте собственный слой координации, когда идентификация, правила инструментов, бизнес-правила, граница развёртывания или оценка должны существенно отличаться от стандартных настроек продукта. Собственная разработка оправдана требованиями к контролю, а не желанием заново собрать телефонную инфраструктуру.
Привлекайте партнёра по внедрению, когда сложная часть охватывает проектирование рабочего процесса, права инструментов, решения по согласию и хранению, проверку сбоев и ответственность за запуск в нескольких системах. Партнёр должен оставить наблюдаемые доказательства работы и пакет для эксплуатационной передачи, а не только убедительную голосовую демонстрацию.
Статьи затрат, которые нужно запросить до подписания
Не сравнивайте поставщиков по одной рекламной цене за минуту. Запрашивайте полную модель затрат на телефонную связь, распознавание и синтез речи, работу модели, одновременные сеансы, аренду номера, записи и расшифровки, вызовы инструментов, передачу человеку, проверку качества, поддержку и минимальные обязательства.
Также учитывайте неудачные звонки и последующее исправление людьми. Более дешёвая минута может обойтись дороже, если задержка вызывает повторные звонки, при передаче теряется контекст или руководителям приходится восстанавливать каждое обращение.
Для оценки партнёра за пределами голосового канала используйте статью как выбрать партнёра по внедрению ИИ-агентов в эксплуатацию.
Запись, согласие и правила исходящих звонков
Этот раздел - не юридическая консультация и не универсален. Правила отличаются по странам, штатам США, индустриям и типу звонка. Привлеките юриста по вашим юрисдикциям до начала записи или исходящих звонков с голосовым ИИ.
Запись
Поставщики телефонии предупреждают, что запись требует соблюдения законов о согласии, а практика различается по юрисдикциям, включая Закон Калифорнии о вторжении в частную жизнь и аналогичные законы других регионов (Twilio Record legal notice). В статье Twilio о соблюдении требований говорится, что рекомендуемая практика состоит в применении самых строгих подходящих правил согласия и получении согласия всех участников до записи (Twilio legal considerations for recording).
Рекомендация:
- решите, записываете ли вы звук, храните расшифровки или делаете и то и другое;
- сообщайте о записи и использовании ИИ там, где этого требует закон или политика бренда;
- зафиксируйте срок хранения, роли доступа и процесс удаления до начала пилотного трафика;
- по возможности удаляйте из журналов платёжные данные и государственные идентификаторы.
Исходящие звонки с голосовым ИИ на примере TCPA в США
В США декларативное постановление FCC 24-17, опубликованное 8 февраля 2024 года, подтверждает, что ограничения TCPA на «искусственный или предварительно записанный голос» распространяются на технологии искусственного интеллекта, генерирующие человеческие голоса, поэтому подпадающие под эти правила звонки обычно требуют предварительного явного согласия вызываемой стороны, если нет чрезвычайной цели или исключения (FCC 24-17 PDF).
Это постановление относится к TCPA в США. Другие страны регулируют автоматические и маркетинговые звонки другими законами. Не переносите американскую форму согласия на другой рынок и не считайте задачу решённой.
Рекомендация: рассматривайте исходящие звонки с голосовым ИИ как отдельный от входящих частых вопросов пилот с реестром согласий, разрешёнными часами, обработкой отказов и безусловной остановкой при спорных или агрессивных ответах.
Передача человеку, резервный путь и тёплый перевод
При проектировании голосовой системы для реальной эксплуатации исходите из того, что агент будет ошибаться в разговоре с клиентами.
Спроектируйте три выхода:
- Передача по правилам - запрос выходит за границы процесса или несёт высокий риск.
- Передача из-за низкой уверенности - качество расшифровки, идентификации или поиска недостаточно для безопасного продолжения.
- Резервный путь при системном сбое - ошибки модели, STT, TTS или поставщика телефонии; перевод в очередь к человеку или структурированный обратный звонок.
При тёплом переводе нужно передать компактный пакет: состояние проверки личности, намерение звонящего, уже использованные инструменты, краткое содержание разговора и запрещённые следующие действия. Принципы передачи из чатов остаются полезными; см. проектирование передачи человеку, даже если каналом служит телефон, а не Telegram.
Рекомендация: никогда не заканчивайте неудачный звонок тишиной или бесконечным повторением «Я не расслышал». Предложите соединение с человеком, обратный звонок или явное завершение разговора.
Наблюдаемость и измерение пилота
NIST AI Risk Management Framework является добровольной системой, но даёт операционным командам полезный язык: определять роли во взаимодействии людей и ИИ, измерять и контролировать системы и помнить, что люди могут чрезмерно доверять автоматическому поведению (NIST AI RMF 1.0, NIST AI RMF hub).
Данные для журналирования именно голосового канала:
- идентификаторы сеанса и звонка;
- отметки времени реплик и события перебивания;
- расшифровка и признаки удаления чувствительных данных;
- название инструмента, очищенные аргументы и состояние результата;
- коды причин передачи человеку;
- результат перевода;
- версии модели, системных инструкций и схем инструментов;
- коды ошибок поставщика.
Об общей схеме журналирования для реальной эксплуатации читайте в статье наблюдаемость агента: журналы, трассировки и хранение.
Карта оценки пилота с собственными порогами
| Мера | Почему важна | Как проверять |
|---|---|---|
| Завершение задачи в ограниченном рабочем процессе | Завершилась ли пилотная работа без скрытого исправления человеком? | Выборка звонков и фактические данные системы |
| Доля обязательной передачи человеку | Агент слишком осторожен, слишком самоуверен или правильно ограничен? | Распределение кодов причин |
| Полнота пакета передачи | Может ли человек продолжить без повторного опроса звонящего? | Контрольный список руководителя |
| Блокировка неразрешённых попыток вызвать инструменты | Реальны ли ограничения прав? | Журнал аудита безопасности и инструментов |
| Качество перебивания | Ответ обрывается слишком поздно, слишком рано или из-за шума? | Размеченные примеры перебиваний |
| Ошибки идентификации | Риск раскрытия данных другому человеку | Случаи несовпадения и нескольких совпадений |
| Нарушения согласия или уведомления | Соответствие требованиям записи и исходящих звонков | Совместная проверка юристов и операционной команды |
| Время до начала звука / время до решения | Задержка и замедление процесса | Инструментальные измерения, а не отдельные истории |
До запуска прогоните эталонный набор сценариев звонков и проверки на неблагоприятных случаях. Используйте метод из статьи как оценивать ИИ-агентов перед запуском. До полного переключения телефонного номера предпочитайте теневой режим или ограниченный пробный трафик (теневой режим и пробный запуск для ИИ-агентов).
Не публикуйте показатели «самостоятельно завершённых обращений» ради красивой отчётности без определения этого понятия и указания, кто исправлял результат после звонка.
Режимы сбоев
Эти режимы повторяются в голосовых системах реальной эксплуатации. Более широкий перечень читайте в статье режимы сбоев агентов в реальной эксплуатации.
| Режим сбоя | Что слышит звонящий | Мера контроля |
|---|---|---|
| Задержка уровня демонстрации | Долгая тишина после каждой реплики | Измерять полное время; упрощать рассуждение на простых репликах; голосом сообщать состояние выполнения |
| Нельзя перебить агента | Звонящий говорит поверх продолжающегося монолога | Разрешить перебивание; очищать буферы воспроизведения; обрезать историю до реально услышанного звука |
| Ложные перебивания | Агент останавливается из-за шума или короткого подтверждения | Адаптивно обрабатывать перебивания или настроить пороги; продолжать после ложного перебивания |
| Выдуманные правила | Уверенно названы неверные часы, цена или медицинская рекомендация | Опирайте ответы на источники; отказывайтесь отвечать без них; передавайте человеку |
| Избыточные права инструментов | Агент случайно создаёт запись, возвращает деньги или меняет состояние учётной записи | Списки разрешений, точки контроля записи, согласование человеком |
| Слабая идентификация | Данные учётной записи прочитаны постороннему человеку | Усиленная проверка до чтения чувствительных данных |
| Незаметный сбой перевода | Бесконечное «Оставайтесь на линии» | Контролировать состояние очереди; сообщать о резервном пути; предлагать обратный звонок |
| Запись без способа получить согласие | Юридический и репутационный риск | Проверка юрисдикции, уведомление, правила хранения |
| Исходящий звонок без согласия | Регуляторный риск и жалобы | Реестр согласий, проверки по классу TCPA там, где применимо |
| Системные инструкции без владельца | Поведение меняется после «небольших» правок | Версионировать инструкции и инструменты; использовать пробный запуск; назначить ответственного |
Антипаттерны:
- покупать голосовую систему из-за забавной демонстрации без карты рабочего процесса;
- начинать с полностью автоматической записи и платежей;
- утверждать, что система заменит команду контактного центра;
- пропускать проверку расшифровок, потому что «голос звучал хорошо»;
- использовать одну общую учётную запись администратора для всех инструментов.
Частые вопросы
Нужна ли сквозная обработка речи или достаточно STT и TTS?
Оба варианта могут работать. Сквозная обработка речи обычно лучше поддерживает естественное перебивание и короткую задержку до начала ответа. Последовательная цепочка STT, LLM и TTS часто подходит лучше, когда нужны строгие промежуточные проверки, надёжные текстовые этапы или повторное использование существующего текстового агента (OpenAI voice agents). Выбирайте по требованиям к контролю, а не по маркетинговым названиям.
Должен ли голосовой агент сообщать, что он является ИИ?
Часто да в рамках политики бренда и доверия, а иногда это юридическое или договорное требование. Правила зависят от юрисдикции и отрасли. Сообщайте об этом в первой реплике и уведомлении о записи, а не добавляйте после жалобы.
Насколько большим должен быть первый пилот?
Рекомендация: один рабочий процесс, один язык, одна телефонная линия или очередь, фиксированный период проверки и назначенный ответственный. Расширяйтесь только после прохождения карты оценки на реальном трафике, а не после внутреннего дня демонстраций.
Следующий шаг с Dali
Если нужен голосовой пилот для реальной эксплуатации, а не ещё одна эффектная демонстрация, принесите один телефонный рабочий процесс, проект правил записи и согласия для ваших юрисдикций и имя ответственного от операционной команды.
Dali поможет составить карту контура управления, прав инструментов, пакета передачи человеку и системы оценки до полного переключения телефонного номера.
Запишитесь на проектную сессию по голосовому агенту с ограниченным объёмом, заранее описав рабочий процесс и ограничения.
