Блог

Обновлено 16 мин чтенияСценарии и процессыСтатья

Голосовые ИИ-агенты для бизнеса: руководство по пилоту в реальной эксплуатации

Определите, подходит ли вам пилот голосового ИИ-агента, а до масштабирования выберите архитектуру, допустимую задержку, инструменты, правила согласия, эскалацию, оценку и модель затрат.

Dali

Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.

David Hakobyan · LinkedIn · Dali

Контур управления голосовым агентом в реальной эксплуатации: слушать, понимать, принимать решение, действовать через инструменты, отвечать голосом, затем передавать человеку или измерять результат

Голосовой ИИ-агент для бизнеса подходит для первого пилота, когда один частый телефонный процесс имеет узкие границы, достаточно обратим для безопасного контроля и уже выполняется людьми по понятным критериям успеха.

Это плохой первый проект, если настоящая проблема состоит в отсутствии регламентов, хаотичных календарях, неясной идентификации или желании «заменить контактный центр» без измерений.

Готовность голоса к реальной эксплуатации означает больше, чем естественно звучащая демонстрация. Она требует выбранной аудиоархитектуры, управления очередностью реплик и перебиваниями, ограниченных инструментов, правил идентификации, политики записи и согласия, передачи человеку, резервного пути при сбое системы и плана оценки до роста трафика.

Голосовые агенты не заменяют команду контактного центра. В лучшем случае они берут определённый срез рутины, готовят контекст для людей и чисто эскалируют, когда кейс выходит за политику.

Если сначала нужно определить агента для реальной эксплуатации без привязки к каналу, начните со статей что такое ИИ-агент для реальной эксплуатации и ИИ-агенты для бизнеса в реальной эксплуатации. Эта статья посвящена устройству и контролю именно голосового пилота.

Когда голосовой пилот уместен

Рекомендация: стартуйте только когда верно всё перечисленное.

  1. Вы можете описать один процесс от начала до конца, например входящие вопросы о часах работы и маршрутизацию, приём записи только с подтверждением, проверку статуса заказа или ответы на частые вопросы после визита.
  2. Процесс уже выполняется людьми, даже если пока он описан неполно и работает нестабильно.
  3. Для неверных ответов предусмотрен понятный путь восстановления, например перенос записи, проверка возврата или обратный звонок руководителя.
  4. Вы можете записывать или восстанавливать реплики для проверки, не создавая программу соответствия требованиям в день запуска.
  5. Назначен ответственный за задержки, смену модели или системных инструкций и инциденты поставщика.

Подождите или выберите другой канал, когда:

  • звонок в основном про переговоры, кризис, медицинское суждение или юридическое обязательство;
  • системы учёта, включая календарь, CRM и остатки, недостоверны;
  • никто не будет разбирать транскрипты или тёплые переводы;
  • исходящие звонки - первая идея, а согласие не решено.

Текстовые каналы часто лучше для асинхронной работы. См. правила для каналов WhatsApp, Slack и электронной почты и когда ИИ-агентов ещё не стоит использовать.

Сначала составьте карту процесса, а затем выбирайте поставщика голосовой системы. Метод из статьи как составить карту рабочих процессов для ИИ-агентов остаётся применимым: опишите шаги, инструменты, цену ошибки и точки обязательного согласования человеком.

Архитектура: сквозная обработка речи или последовательная цепочка

Документация основных платформ описывает две полноценные архитектуры голосовых систем (OpenAI voice agents).

АрхитектураКак работаетКогда подходит лучшеКомпромисс
Сквозной голосовой сеансМодель принимает и выдаёт звук в рамках сеанса реального времениЕстественная смена реплик, перебивание, небольшая задержка до начала ответа и использование инструментов в реальном времениПромежуточный текст менее заметен; проверка правил и надёжное хранение расшифровок требуют отдельного проектирования
Цепочка STT → текстовый агент → TTSПриложение управляет распознаванием, рассуждением и синтезом речи как отдельными этапамиПроцессы с серьёзными согласованиями, заменяемые STT и TTS, более полный аудит промежуточных этаповДополнительные переходы могут увеличить задержку; смену реплик нужно настраивать между компонентами

Руководство OpenAI предлагает сквозную обработку речи как обычную отправную точку, когда взаимодействие должно быть естественным и мгновенным, включая перебивание и инструменты реального времени. Последовательная цепочка подходит лучше, когда нужен явный контроль промежуточного текста, повторное использование существующего текстового агента или надёжно отделённые этапы.

Документация Deepgram Voice Agent похожим образом описывает цепочку, которая объединяет прослушивание, рассуждение и речь, но позволяет настраивать STT, LLM, TTS, определение конца реплики и формат звука (Deepgram Voice Agent).

Рекомендация: выбирайте архитектуру прежде всего по требованиям к контролю и проверке, а не по эффектности демонстрации. Многие команды используют сквозную обработку речи ради естественного разговора, но всё равно выполняют действия с бизнес-последствиями через серверный слой инструментов со строгими списками разрешений.

Сеансы реального времени держат соединение открытым для звука, событий, вызовов инструментов и состояния сеанса (OpenAI Realtime). Это инфраструктура, а не готовая бизнес-система.

Контур управления голосового агента: захват звука, расшифровка, решение, ограниченные инструменты, голосовой ответ, передача человеку и измерение

Голосовой агент для реальной эксплуатации работает в замкнутом контуре управления: принимает звук, понимает реплику, принимает решение в рамках правил, действует только разрешёнными инструментами, отвечает голосом, а затем передаёт разговор человеку или сохраняет данные для проверки. Если какой-то блок отсутствует, считайте систему демо.

Таблица решений по процессам

Таблица ниже представляет собой рекомендуемую отправную точку, а не стандарт зрелости или отчёт о результатах клиентов. Определяйте степень автономности по цене ошибки, обратимости и возможности обнаружить сбой.

Тип процессаНачальная автономностьНужные инструментыПередача человекуДоказательства оценки
Входящие вопросы о часах работы, расположении и частые вопросыОтвечать только по утверждённым знаниям; не выполнять действий с последствиямиПоиск по базе знаний, правила часов работыПередавать человеку, когда источник отсутствует, противоречив или звонящий настаивает на разговоре с сотрудникомДоля подтверждённых ответов, корректность ссылок на источники, доля обязательных передач человеку
Приём записи со сбором данных и предложениемСобрать предпочтения по времени; запись подтверждает человек или системаЧтение календаря, поля квалификации, черновая заметка в CRMЧеловек подтверждает запись, отмену или перенос, либо разрешает запись через контрольную точкуСлучаи двойной записи, доля пропущенных полей, время до подтверждения
Статус заказа или заявкиПоиск только для чтения после проверки личностиМетод идентификации, API заказа или заявки только для чтенияПередавать человеку при несовпадении, нескольких результатах или признаках риска для учётной записиДоля неудачной идентификации, точность поиска, случаи устаревших данных
Квалификация входящих обращенийЗадавать структурированные вопросы; создавать потенциального клиента в CRM; не давать исходящих обещанийСоздание и обновление в CRM с ограниченными правами, правила маршрутизацииПередавать готовые к продаже обращения с полным пакетом контекстаПолнота полей, доля неподходящих обращений, принятие передачи
Обсуждение платежа или возвратаТолько готовить объяснение; никогда не перемещать деньгиДокументы правил, чтение учётной записиЧеловек одобряет любое начисление, возврат или изменение планаЗаблокированные попытки неразрешённых действий, отклонённые согласования, число инцидентов
Исходящее напоминание или уведомление, если это законноСтрогий сценарий и вызовы инструментов; остановка при любом возраженииРеестр согласий, чтение календаря и CRM, управление набором номераНемедленная передача человеку или обратный звонок при жалобе или сложном ответеНаличие доказательств согласия, обработка отказов, доля жалоб
Тёплая передача после частичного решенияАгент собирает контекст и соединяет с сотрудникомОчередь или перевод в телефонии, запись заметки по обращениюЧеловек отвечает за оставшуюся часть решенияПолнота пакета передачи, доля возвратов к агенту, время до речи сотрудника

Гипотетический пример: клиника с несколькими филиалами может пилотировать приём записи с чтением календаря и подтверждением человеком до любой записи, а не с полной автоматической записью ко всем специалистам.

О текстовой поддержке, которая позднее сможет использовать общие знания и точки контроля с голосовым каналом, читайте в статье сценарии ИИ-агентов для клиентской поддержки.

Задержка, смена реплик, перебивание и расшифровка

Задержка

Голос ощущается сломанным, когда тишина тянется после того, как звонящий закончил мысль. Основные руководства платформ подчёркивают важность короткой задержки до начала звукового ответа в разговорных сеансах и советуют балансировать глубину рассуждения со скоростью реакции: OpenAI документирует настраиваемые уровни рассуждения, причём низкий уровень используется по умолчанию во многих голосовых сценариях реального времени (OpenAI voice models announcement).

Рекомендация: измеряйте в своей системе полное время от конца речи пользователя до первого слышимого ответа агента на реальных телефонных и браузерных маршрутах. Не превращайте чужую маркетинговую цель в миллисекундах в свой стандарт. Также измеряйте ожидание вызова инструмента: если агент ищет запись, он должен сообщить об этом и допускать перебивание там, где это безопасно.

Смена реплик и перебивание

Определение границ реплики устанавливает, когда пользователь закончил говорить и когда речь во время ответа должна остановить агента (LiveKit turns overview). Платформы предлагают разные режимы: определение конца реплики моделью, серверный VAD для моделей реального времени, только VAD, определение конца речи средствами STT или ручной режим «нажми и говори».

Возможность перебить агента нужна обязательно. LiveKit документирует остановку речи агента при начале речи пользователя, обрезку истории до реально услышанного, адаптивное различение настоящих перебиваний и коротких подтверждающих звуков, а также настраиваемое восстановление после ложных перебиваний. Google Dialogflow CX документирует перебивание, чтобы звонящий мог остановить звуковой ответ: агент прекращает отправлять звук и обрабатывает следующую реплику (Dialogflow CX advanced speech).

Рекомендация для пилотов:

  • включайте перебивание для разговорных ответов на частые вопросы и первичного сбора данных;
  • осторожно настраивайте определение конца реплики для шумного телефонного звука: LiveKit отмечает более высокие пороги VAD как подход для телефонии на шумных линиях;
  • определите поведение при перебивании во время вызова инструмента: отменить, завершить в фоне или продолжить позднее;
  • журналируйте события перебивания, чтобы исправлять ложные обрывы.

Расшифровка

Даже системам со сквозной обработкой речи обычно нужна расшифровка для проверки качества и заметок в CRM. Последовательные цепочки делают расшифровку полноценным отдельным этапом. Системам со сквозной обработкой речи по той же причине нужен явный способ её сохранения.

Рекомендация: храните очищенную от чувствительных данных расшифровку, показатели уверенности или неопределённости, если они доступны, язык и отметки времени, сопоставленные с вызовами инструментов. Не считайте расшифровку юридически достоверной записью без правил хранения и доступа.

Идентификация, инструменты и права

Голосовой агент, который может «делать всё, что доступно сотруднику поддержки», не готов к реальной эксплуатации.

Базовые рекомендации для агентов остаются применимыми: нужны модели, инструменты и инструкции, а также вмешательство человека после достижения порогов сбоя и до действий с высоким риском (OpenAI practical guide to building agents). Документация голосовых агентов так же явно предусматривает инструменты, передачу задач, защитные ограничения и проверку человеком, как и документация текстовых агентов (OpenAI voice agents, guardrails and human review).

Рекомендация:

  • проверяйте личность до ответов по конкретной учётной записи: одного номера звонящего недостаточно для действий с высоким риском;
  • используйте минимально необходимые области прав инструментов и списки разрешений (безопасные вызовы инструментов для бизнес-агентов);
  • разделяйте инструменты чтения и записи;
  • требуйте согласования человеком для перемещения денег, юридических обязательств, восстановления после захвата учётной записи и необратимой отмены (ИИ-агенты с участием человека);
  • дайте агенту отдельную машинную идентичность с ротацией данных доступа, аудитом и аварийным отключением, а не общий пароль сотрудника.

Использование инструментов во время разговора должно оставаться понятным, когда возникает ожидание. В материалах OpenAI о голосовых продуктах реального времени описаны параллельные вызовы инструментов и слышимые сообщения о состоянии, например уведомление о проверке календаря во время выполнения (OpenAI voice models announcement). Считайте это принципом взаимодействия, а не доказательством качественной реализации у каждого поставщика.

Купить, собрать или привлечь партнёра по внедрению

Выбирайте управляемый голосовой продукт, когда процесс укладывается в штатные интеграции, модель согласования, управление расшифровками и правила передачи человеку без собственной системы координации. Часто это самый быстрый вариант для узкого пилота виртуального администратора, маршрутизации или ответов на частые вопросы, где платформа уже предоставляет нужные телефонные пути и интеграции с CRM.

Создавайте собственный слой координации, когда идентификация, правила инструментов, бизнес-правила, граница развёртывания или оценка должны существенно отличаться от стандартных настроек продукта. Собственная разработка оправдана требованиями к контролю, а не желанием заново собрать телефонную инфраструктуру.

Привлекайте партнёра по внедрению, когда сложная часть охватывает проектирование рабочего процесса, права инструментов, решения по согласию и хранению, проверку сбоев и ответственность за запуск в нескольких системах. Партнёр должен оставить наблюдаемые доказательства работы и пакет для эксплуатационной передачи, а не только убедительную голосовую демонстрацию.

Статьи затрат, которые нужно запросить до подписания

Не сравнивайте поставщиков по одной рекламной цене за минуту. Запрашивайте полную модель затрат на телефонную связь, распознавание и синтез речи, работу модели, одновременные сеансы, аренду номера, записи и расшифровки, вызовы инструментов, передачу человеку, проверку качества, поддержку и минимальные обязательства.

Также учитывайте неудачные звонки и последующее исправление людьми. Более дешёвая минута может обойтись дороже, если задержка вызывает повторные звонки, при передаче теряется контекст или руководителям приходится восстанавливать каждое обращение.

Для оценки партнёра за пределами голосового канала используйте статью как выбрать партнёра по внедрению ИИ-агентов в эксплуатацию.

Запись, согласие и правила исходящих звонков

Этот раздел - не юридическая консультация и не универсален. Правила отличаются по странам, штатам США, индустриям и типу звонка. Привлеките юриста по вашим юрисдикциям до начала записи или исходящих звонков с голосовым ИИ.

Запись

Поставщики телефонии предупреждают, что запись требует соблюдения законов о согласии, а практика различается по юрисдикциям, включая Закон Калифорнии о вторжении в частную жизнь и аналогичные законы других регионов (Twilio Record legal notice). В статье Twilio о соблюдении требований говорится, что рекомендуемая практика состоит в применении самых строгих подходящих правил согласия и получении согласия всех участников до записи (Twilio legal considerations for recording).

Рекомендация:

  • решите, записываете ли вы звук, храните расшифровки или делаете и то и другое;
  • сообщайте о записи и использовании ИИ там, где этого требует закон или политика бренда;
  • зафиксируйте срок хранения, роли доступа и процесс удаления до начала пилотного трафика;
  • по возможности удаляйте из журналов платёжные данные и государственные идентификаторы.

Исходящие звонки с голосовым ИИ на примере TCPA в США

В США декларативное постановление FCC 24-17, опубликованное 8 февраля 2024 года, подтверждает, что ограничения TCPA на «искусственный или предварительно записанный голос» распространяются на технологии искусственного интеллекта, генерирующие человеческие голоса, поэтому подпадающие под эти правила звонки обычно требуют предварительного явного согласия вызываемой стороны, если нет чрезвычайной цели или исключения (FCC 24-17 PDF).

Это постановление относится к TCPA в США. Другие страны регулируют автоматические и маркетинговые звонки другими законами. Не переносите американскую форму согласия на другой рынок и не считайте задачу решённой.

Рекомендация: рассматривайте исходящие звонки с голосовым ИИ как отдельный от входящих частых вопросов пилот с реестром согласий, разрешёнными часами, обработкой отказов и безусловной остановкой при спорных или агрессивных ответах.

Передача человеку, резервный путь и тёплый перевод

При проектировании голосовой системы для реальной эксплуатации исходите из того, что агент будет ошибаться в разговоре с клиентами.

Спроектируйте три выхода:

  1. Передача по правилам - запрос выходит за границы процесса или несёт высокий риск.
  2. Передача из-за низкой уверенности - качество расшифровки, идентификации или поиска недостаточно для безопасного продолжения.
  3. Резервный путь при системном сбое - ошибки модели, STT, TTS или поставщика телефонии; перевод в очередь к человеку или структурированный обратный звонок.

При тёплом переводе нужно передать компактный пакет: состояние проверки личности, намерение звонящего, уже использованные инструменты, краткое содержание разговора и запрещённые следующие действия. Принципы передачи из чатов остаются полезными; см. проектирование передачи человеку, даже если каналом служит телефон, а не Telegram.

Рекомендация: никогда не заканчивайте неудачный звонок тишиной или бесконечным повторением «Я не расслышал». Предложите соединение с человеком, обратный звонок или явное завершение разговора.

Наблюдаемость и измерение пилота

NIST AI Risk Management Framework является добровольной системой, но даёт операционным командам полезный язык: определять роли во взаимодействии людей и ИИ, измерять и контролировать системы и помнить, что люди могут чрезмерно доверять автоматическому поведению (NIST AI RMF 1.0, NIST AI RMF hub).

Данные для журналирования именно голосового канала:

  • идентификаторы сеанса и звонка;
  • отметки времени реплик и события перебивания;
  • расшифровка и признаки удаления чувствительных данных;
  • название инструмента, очищенные аргументы и состояние результата;
  • коды причин передачи человеку;
  • результат перевода;
  • версии модели, системных инструкций и схем инструментов;
  • коды ошибок поставщика.

Об общей схеме журналирования для реальной эксплуатации читайте в статье наблюдаемость агента: журналы, трассировки и хранение.

Карта оценки пилота с собственными порогами

МераПочему важнаКак проверять
Завершение задачи в ограниченном рабочем процессеЗавершилась ли пилотная работа без скрытого исправления человеком?Выборка звонков и фактические данные системы
Доля обязательной передачи человекуАгент слишком осторожен, слишком самоуверен или правильно ограничен?Распределение кодов причин
Полнота пакета передачиМожет ли человек продолжить без повторного опроса звонящего?Контрольный список руководителя
Блокировка неразрешённых попыток вызвать инструментыРеальны ли ограничения прав?Журнал аудита безопасности и инструментов
Качество перебиванияОтвет обрывается слишком поздно, слишком рано или из-за шума?Размеченные примеры перебиваний
Ошибки идентификацииРиск раскрытия данных другому человекуСлучаи несовпадения и нескольких совпадений
Нарушения согласия или уведомленияСоответствие требованиям записи и исходящих звонковСовместная проверка юристов и операционной команды
Время до начала звука / время до решенияЗадержка и замедление процессаИнструментальные измерения, а не отдельные истории

До запуска прогоните эталонный набор сценариев звонков и проверки на неблагоприятных случаях. Используйте метод из статьи как оценивать ИИ-агентов перед запуском. До полного переключения телефонного номера предпочитайте теневой режим или ограниченный пробный трафик (теневой режим и пробный запуск для ИИ-агентов).

Не публикуйте показатели «самостоятельно завершённых обращений» ради красивой отчётности без определения этого понятия и указания, кто исправлял результат после звонка.

Режимы сбоев

Эти режимы повторяются в голосовых системах реальной эксплуатации. Более широкий перечень читайте в статье режимы сбоев агентов в реальной эксплуатации.

Режим сбояЧто слышит звонящийМера контроля
Задержка уровня демонстрацииДолгая тишина после каждой репликиИзмерять полное время; упрощать рассуждение на простых репликах; голосом сообщать состояние выполнения
Нельзя перебить агентаЗвонящий говорит поверх продолжающегося монологаРазрешить перебивание; очищать буферы воспроизведения; обрезать историю до реально услышанного звука
Ложные перебиванияАгент останавливается из-за шума или короткого подтвержденияАдаптивно обрабатывать перебивания или настроить пороги; продолжать после ложного перебивания
Выдуманные правилаУверенно названы неверные часы, цена или медицинская рекомендацияОпирайте ответы на источники; отказывайтесь отвечать без них; передавайте человеку
Избыточные права инструментовАгент случайно создаёт запись, возвращает деньги или меняет состояние учётной записиСписки разрешений, точки контроля записи, согласование человеком
Слабая идентификацияДанные учётной записи прочитаны постороннему человекуУсиленная проверка до чтения чувствительных данных
Незаметный сбой переводаБесконечное «Оставайтесь на линии»Контролировать состояние очереди; сообщать о резервном пути; предлагать обратный звонок
Запись без способа получить согласиеЮридический и репутационный рискПроверка юрисдикции, уведомление, правила хранения
Исходящий звонок без согласияРегуляторный риск и жалобыРеестр согласий, проверки по классу TCPA там, где применимо
Системные инструкции без владельцаПоведение меняется после «небольших» правокВерсионировать инструкции и инструменты; использовать пробный запуск; назначить ответственного

Антипаттерны:

  • покупать голосовую систему из-за забавной демонстрации без карты рабочего процесса;
  • начинать с полностью автоматической записи и платежей;
  • утверждать, что система заменит команду контактного центра;
  • пропускать проверку расшифровок, потому что «голос звучал хорошо»;
  • использовать одну общую учётную запись администратора для всех инструментов.

Частые вопросы

Нужна ли сквозная обработка речи или достаточно STT и TTS?

Оба варианта могут работать. Сквозная обработка речи обычно лучше поддерживает естественное перебивание и короткую задержку до начала ответа. Последовательная цепочка STT, LLM и TTS часто подходит лучше, когда нужны строгие промежуточные проверки, надёжные текстовые этапы или повторное использование существующего текстового агента (OpenAI voice agents). Выбирайте по требованиям к контролю, а не по маркетинговым названиям.

Должен ли голосовой агент сообщать, что он является ИИ?

Часто да в рамках политики бренда и доверия, а иногда это юридическое или договорное требование. Правила зависят от юрисдикции и отрасли. Сообщайте об этом в первой реплике и уведомлении о записи, а не добавляйте после жалобы.

Насколько большим должен быть первый пилот?

Рекомендация: один рабочий процесс, один язык, одна телефонная линия или очередь, фиксированный период проверки и назначенный ответственный. Расширяйтесь только после прохождения карты оценки на реальном трафике, а не после внутреннего дня демонстраций.

Следующий шаг с Dali

Если нужен голосовой пилот для реальной эксплуатации, а не ещё одна эффектная демонстрация, принесите один телефонный рабочий процесс, проект правил записи и согласия для ваших юрисдикций и имя ответственного от операционной команды.

Dali поможет составить карту контура управления, прав инструментов, пакета передачи человеку и системы оценки до полного переключения телефонного номера.

Запишитесь на проектную сессию по голосовому агенту с ограниченным объёмом, заранее описав рабочий процесс и ограничения.