ბლოგი

განახლებულია 14 წთ კითხვაგამოყენების სცენარები და პროცესებისტატია

AI ხმოვანი აგენტები ბიზნესისთვის: საწარმოო პილოტის გზამკვლევი

გადაწყვიტეთ, შეეფერება თუ არა AI ხმოვანი აგენტის პილოტი, შემდეგ განსაზღვრეთ არქიტექტურა, დაყოვნება, ხელსაწყოები, თანხმობა, ესკალაცია, შეფასება და ხარჯის ფაქტორები მასშტაბირებამდე.

Dali

Dali არის AI agent systems სტუდია. დავითი - engineering/product, ლიანა - operations/workflow fit. Production აგენტები არსებულ tools-ში.

David Hakobyan · LinkedIn · Dali

საწარმოო ხმოვანი აგენტის მართვის ციკლი: მოსმენა, გაგება, გადაწყვეტა, ხელსაწყოებით მოქმედება, ლაპარაკი, შემდეგ ესკალაცია ან გაზომვა

საწარმოო AI ხმოვანი აგენტი ბიზნესისთვის კარგი პილოტია, როცა ერთი მაღალი მოცულობის სატელეფონო სამუშაო პროცესი ვიწროა, საკმარისად შექცევადია საკონტროლო კარიბჭისთვის და უკვე ეკუთვნის ადამიანურ პროცესს მკაფიო წარმატების კრიტერიუმებით.

ეს ცუდი პირველი პროექტია, როცა რეალური პრობლემაა დაკარგული სტანდარტული ოპერაციული პროცედურები, ქაოტური კალენდრები, გაურკვეველი იდენტობა ან სურვილი „სატელეფონო ცენტრის ჩანაცვლებისა“ გაზომვის გარეშე.

საწარმოო ხმისთვის ეს ნიშნავს უფრო მეტს, ვიდრე ბუნებრივად ჟღერადი დემო. ეს არის არჩეული აუდიოარქიტექტურა, საუბრის რიგისა და შეწყვეტის ქცევა, შეზღუდული ხელსაწყოები, იდენტობის წესები, ჩაწერისა და თანხმობის პოლიტიკა, ადამიანზე ესკალაცია, სათადარიგო გზა როცა ტექნიკური ჯაჭვი იშლება, და შეფასების გეგმა ტრაფიკის ზრდამდე.

ხმოვანი აგენტები სატელეფონო ცენტრის გუნდს არ ცვლიან. საუკეთესო შემთხვევაში ისინი იღებენ რუტინული სამუშაოს განსაზღვრულ ნაწილს, ამზადებენ კონტექსტს ადამიანებისთვის და სუფთად აკეთებენ ესკალაციას, როცა შემთხვევა პოლიტიკას ტოვებს.

თუ ჯერ არხისგან დამოუკიდებელი განმარტება გჭირდებათ საწარმოო აგენტებისა, დაიწყეთ რა არის საწარმოო AI აგენტი და საწარმოო AI აგენტები ბიზნესისთვის. ეს სტატია არის ხმის სპეციფიკური პილოტისა და კონტროლის დიზაინი.

როდის ერგება ხმოვანი პილოტი

რეკომენდაცია: დაიწყეთ მხოლოდ მაშინ, როცა ყველა ქვემოთ ჩამოთვლილი ჭეშმარიტია.

  1. შეგიძლიათ დაასახელოთ ერთი სამუშაო პროცესი თავიდან ბოლომდე (მაგალითად შემომავალი საათები და მარშრუტიზაცია, ვიზიტის მიღება მხოლოდ დადასტურებით, შეკვეთის სტატუსის ძებნა, ან ვიზიტის შემდგომი ხშირად დასმული კითხვები).
  2. ადამიანური პროცესი უკვე არსებობს, თუნდაც უწესრიგო.
  3. არასწორ პასუხებს აქვს ცნობილი აღდგენის გზა (გადანიშვნა, თანხის დაბრუნების განხილვა, ხელმძღვანელის უკუზარი).
  4. შეგიძლიათ ჩაწეროთ ან აღადგინოთ საუბრის ნაბიჯები განხილვისთვის, გაშვების დღეს შესაბამისობის პროგრამის გამოგონების გარეშე.
  5. ვიღაც პასუხისმგებელია შეჩერებებზე, მოდელის ან ინსტრუქციის ცვლილებებზე და მომწოდებლის ინციდენტებზე.

დაელოდეთ ან გამოიყენეთ სხვა არხი, როცა:

  • ზარი ძირითადად მოლაპარაკებაა, კრიზისი, სამედიცინო განსჯა ან იურიდიული ვალდებულება;
  • ჩანაწერების ხელსაწყოები (კალენდარი, CRM, მარაგი) სანდო არ არის;
  • არავინ განიხილავს ტრანსკრიპტებს ან კონტექსტით გადაცემებს;
  • გამავალი ზარები პირველი იდეაა და თანხმობა გადაუჭრელია.

ტექსტური არხები ხშირად უკეთესია ასინქრონული სამუშაოსთვის. იხილეთ WhatsApp, Slack და ელფოსტის არხის წესები და როდის ჯერ არ გამოიყენოთ AI აგენტები.

სამუშაო პროცესის რუკა გააკეთეთ ხმოვანი მომწოდებლის არჩევამდე. მეთოდი როგორ დავამუშაოთ სამუშაო პროცესები AI აგენტებისთვის-დან კვლავ მოქმედებს: ნაბიჯები, ხელსაწყოები, ჩავარდნის ღირებულება და ადამიანური საკონტროლო კარიბჭეები.

არქიტექტურა: ხმა-ხმაზე სისტემა თუ ჯაჭვური მილსადენი

ძირითადი პლატფორმების დოკუმენტაცია აღწერს ორ ლეგიტიმურ ხმოვან არქიტექტურას (OpenAI voice agents).

არქიტექტურაროგორ მუშაობსძლიერი შესაბამისობაკომპრომისი
ხმა-ხმაზე ცოცხალი აუდიოსესიამოდელი იღებს ცოცხალ აუდიოს შემავალსა და გამავალში რეალურ დროში სესიაშიბუნებრივი საუბრის რიგი, საუბრის შეწყვეტა, დაბალი პირველი აუდიოს დაყოვნება, რეალურ დროში ხელსაწყოების გამოყენებაშუალედური ტექსტი ნაკლებად აშკარაა; პოლიტიკის შემოწმებები და მდგრადი ტრანსკრიპტები საჭიროებენ შეგნებულ დიზაინს
ჯაჭვური STT → ტექსტური აგენტი → TTSაპლიკაცია ფლობს ტრანსკრიფციას, მსჯელობას და მეტყველების სინთეზს ცალკე ეტაპებადდამტკიცებით მძიმე ნაკადები, შეცვლადი STT/TTS, უფრო ძლიერი შუალედური აუდიტიდამატებითი ნახტომები დაყოვნებას ამატებენ; საუბრის რიგი კომპონენტებს შორის უნდა დაინჟინროს

OpenAI-ს გზამკვლევი ხმა-ხმაზე არქიტექტურას ჩვეულებრივ საწყის წერტილად განიხილავს, როცა ურთიერთქმედება საუბრისებური და მყისიერი უნდა იყოს, საუბარში შეწყვეტისა და რეალურ დროში ხელსაწყოების ჩათვლით. ჯაჭვურ გზას უკეთესად განიხილავს, როცა გჭირდებათ შუალედური ტექსტის აშკარა კონტროლი, არსებული ტექსტური აგენტის ხელახალი გამოყენება, ან მდგრადი ეტაპების საზღვრები.

Deepgram-ის ხმოვანი აგენტის დოკუმენტაცია მსგავსად აყალიბებს მილსადენს, რომელიც აერთიანებს მოსმენას, აზროვნებასა და ლაპარაკს, მაგრამ ცალკე კონფიგურაციისთვის კვლავ ხელმისაწვდომს ტოვებს STT-ს, LLM-ს, TTS-ს, საუბრის დასრულების ამოცნობასა და აუდიოფორმატს (Deepgram Voice Agent).

რეკომენდაცია: არქიტექტურა აირჩიეთ ჯერ კონტროლისა და განხილვის საჭიროებების მიხედვით, არა დემოს გაპრიალებისთვის. ბევრი საწარმოო გუნდი საუბრის ბუნებრივი შეგრძნებისთვის ხმა-ხმაზე არქიტექტურას იყენებს და მაინც წერს ბიზნესის გვერდით მოქმედებებს სერვერული ხელსაწყოების ფენით მკაცრი ნებადართულთა სიებით.

რეალური დროის სესიები კავშირს ღია ტოვებენ აუდიოსთვის, მოვლენებისთვის, ხელსაწყოების გამოძახებებისა და სესიის მდგომარეობისთვის (OpenAI Realtime). ეს არის ინფრასტრუქტურა, არა დასრულებული ბიზნესსისტემა.

საწარმოო ხმოვანი აგენტის მართვის ციკლი: აღება, ტრანსკრიფცია, გადაწყვეტა, შეზღუდული ხელსაწყოები, მეტყველების გამოსავალი, ადამიანზე ესკალაცია და გაზომვა

საწარმოო ხმოვანი აგენტი დახურული მართვის ციკლია: აუდიოს აღება, ნაბიჯის გაგება, პოლიტიკის ქვეშ გადაწყვეტა, მოქმედება მხოლოდ ნებადართული ხელსაწყოებით, ლაპარაკი, შემდეგ ესკალაცია ან ჟურნალი განხილვისთვის. თუ რომელიმე ყუთი აკლია, სისტემას მოეპყარით როგორც დემოს.

სამუშაო პროცესის გადაწყვეტილების ცხრილი

ქვემოთ მოცემული ცხრილი რეკომენდებული საწყისი რუკაა, არა სიმწიფის სტანდარტი და არა კლიენტის შედეგების ანგარიში. ავტონომია დააყენეთ შეცდომის შედეგის, შექცევადობისა და ჩავარდნის აღმოჩენის უნარის მიხედვით.

სამუშაო პროცესის ტიპისაწყისი ავტონომიასაჭირო ხელსაწყოებიადამიანზე გადაცემაშეფასების მტკიცებულება
შემომავალი საათები, მდებარეობა და ხშირად დასმული კითხვებიპასუხი მხოლოდ დამტკიცებული ცოდნიდან; გვერდითი მოქმედებების გარეშეცოდნის ამოღება, სამუშაო საათების წესებიესკალაცია, როცა წყარო აკლია, კონფლიქტშია, ან მომრეკავი ადამიანს ითხოვსმხარდაჭერილი პასუხის წილი, ციტირების ვალიდობა, იძულებითი ესკალაციის წილი
ვიზიტის მიღება (აღება + შეთავაზება)სასურველი დროის შეგროვება; ადამიანი ან სისტემა ადასტურებს ჩაწერასკალენდრის კითხვა, კვალიფიკაციის ველები, CRM-ის მონახაზი შენიშვნადაჯავშნის, გაუქმების ან გადანიშვნის დადასტურება ადამიანით ან კარიბჭით ჩაწერითორმაგი დაჯავშნის ინციდენტები, გამოტოვებული ველის წილი, დადასტურების დაყოვნება
შეკვეთის ან ბილეთის სტატუსიმხოლოდ კითხვის ძებნა იდენტობის შემოწმების შემდეგავტორიზაციის მეთოდი, შეკვეთის/ბილეთის API (კითხვა)ესკალაცია შეუსაბამობაზე, მრავალ დამთხვევაზე ან ანგარიშის რისკის ნიშნებზეავტორიზაციის ჩავარდნის წილი, ძებნის სიზუსტე, მოძველებული მონაცემების ინციდენტები
ლიდების კვალიფიკაცია შემომავალ ზარებზესტრუქტურირებული კითხვები; CRM-ში ლიდის შექმნა; გამავალი დაპირებების გარეშეCRM-ის შექმნა/განახლება (შეზღუდული), მარშრუტიზაციის წესებიგაყიდვებისთვის მზა ლიდების გადაცემა სრული კონტექსტის პაკეტითველების სისრულე, ცუდი ლიდის წილი, გადაცემის მიღება
გადახდის ან თანხის დაბრუნების განხილვამხოლოდ ახსნის მონახაზი; ფულადი მოძრაობები არასოდესპოლიტიკის დოკუმენტები, ანგარიშის კითხვაადამიანი ამტკიცებს ნებისმიერ კრედიტს, თანხის დაბრუნებას ან გეგმის ცვლილებასდაბლოკილი უნებართვო მოქმედებების მცდელობები, დამტკიცების უარყოფები, ინციდენტების რაოდენობა
გამავალი შეხსენება ან შეტყობინება (სადაც კანონიერია)მკაცრი სცენარი + ხელსაწყოების გამოძახებები; გაჩერება ნებისმიერ დავაზეთანხმობის საცავი, კალენდრის/CRM-ის კითხვა, დამრეკავის კონტროლიმყისიერი გადაცემა ან უკუზარი საჩივარზე ან რთულ პასუხზეთანხმობის მტკიცებულების დაფარვა, უარის დამუშავება, საჩივრების წილი
კონტექსტით გადაცემა ნაწილობრივი გადაწყვეტის შემდეგაგენტი აგროვებს კონტექსტს, შემდეგ აკავშირებსრიგის / პროგრამული ტელეფონის გადაცემა, საქმის შენიშვნის ჩაწერაადამიანი ფლობს დარჩენილ გადაწყვეტასგადაცემის სისრულე, უკან დაბრუნების წილი, დრო ადამიანის მეტყველებამდე

ჰიპოთეტური მაგალითი: მრავალლოკაციიან კლინიკას შეუძლია ვიზიტის მიღების პილოტი კალენდრის კითხვითა და ადამიანის დადასტურებით ნებისმიერ ჩაწერამდე, არა სრული ავტომატური დაჯავშნა პროვაიდერებზე.

ტექსტზე დაფუძნებული მხარდაჭერის ნიმუშებისთვის, რომლებიც მოგვიანებით ხმასთან გაიზიარებენ ცოდნასა და საკონტროლო კარიბჭეებს, იხილეთ AI აგენტების გამოყენების შემთხვევები მომხმარებელთა მხარდაჭერისთვის.

დაყოვნება, საუბრის რიგი, შეწყვეტა და ტრანსკრიფცია

დაყოვნება

ხმა გატეხილად იგრძნობა, როცა სიჩუმე იწელება მას შემდეგ, რაც მომრეკავმა აზრი დაასრულა. პირველადი პროდუქტის სახელმძღვანელო ხაზს უსვამს დაბალ პირველი აუდიოს დაყოვნებას საუბრისებური სესიებისთვის და გვირჩევს მსჯელობის ძალისხმევის დაბალანსებას რეაგირებისუნარიანობასთან (OpenAI დოკუმენტირებს მორგებად მსჯელობის დონეებს, low დონით როგორც ნაგულისხმევი ბევრი რეალური დროის ხმოვანი გამოყენებისთვის) (OpenAI voice models announcement).

რეკომენდაცია: გაზომეთ თავიდან ბოლომდე დრო მომხმარებლის მეტყველების დასრულებიდან აგენტის პირველ გასაგონ აუდიომდე თქვენს ტექნიკურ ჯაჭვში, რეალურ სატელეფონო ან ბრაუზერის გზებზე. ნუ შემოიტანთ სხვის მილიწამიან მარკეტინგულ სამიზნეს როგორც სტანდარტს. ასევე გაზომეთ ხელსაწყოს გამოძახების ლოდინი: თუ აგენტმა ჩანაწერი უნდა ნახოს, ეს უნდა თქვას და შეწყვეტადი დარჩეს, სადაც უსაფრთხოა.

საუბრის რიგი და შეწყვეტა

რიგის დეტექცია წყვეტს, როდის დაასრულა მომხმარებელმა ლაპარაკი და როდის უნდა შეაჩეროს პასუხის შუაში მეტყველებამ აგენტი (LiveKit turns overview). პლატფორმები გვთავაზობენ სხვადასხვა რეჟიმს: მოდელზე დაფუძნებული რიგის დასრულება, სერვერული VAD რეალური დროის მოდელებზე, მხოლოდ VAD, STT საუბრის დასრულების ამოცნობა ან ხელით ღილაკით საუბარი.

საუბრის შეწყვეტა სასურველი დანამატი არ არის. LiveKit დოკუმენტირებს აგენტის მეტყველების შეჩერებას მომხმარებლის მეტყველებაზე, ისტორიის შეკვეცას იმაზე, რაც მომხმარებელმა რეალურად გაიგონა, ადაპტურ დამუშავებას, რომელიც ცდილობს გამოყოს ნამდვილი შეწყვეტები უკუკავშირის ხმებისგან, და კონფიგურირებად აღდგენას ცრუ შეწყვეტებისგან. Google Dialogflow CX დოკუმენტირებს საუბარში შეწყვეტის ფუნქციას, რომ მომრეკავებმა შეძლონ პასუხის აუდიოს შეწყვეტა; შეწყვეტისას აგენტი წყვეტს აუდიოს გაგზავნას და ამუშავებს შემდეგ შეყვანას (Dialogflow CX advanced speech).

რეკომენდაცია პილოტებისთვის:

  • ჩართეთ საუბრის შეწყვეტა საუბრისებური ხშირად დასმული კითხვებისა და მიღებისთვის;
  • ფრთხილად დაარეგულირეთ საუბრის დასრულების ამოცნობა ხმაურიან სატელეფონო აუდიოზე (LiveKit აღნიშნავს უფრო მაღალ VAD ზღვრებს როგორც ტელეფონიისთვის ორიენტირებულ ნიმუშს ხმაურიანი ხაზებისთვის);
  • განსაზღვრეთ ქცევა, როცა მომხმარებელი ხელსაწყოს გამოძახების შუაში წყვეტს (გაუქმება, ფონში დასრულება ან გაგრძელება);
  • დაალოგეთ შეწყვეტის მოვლენები, რომ ცრუ გაწყვეტები გამოასწოროთ.

ტრანსკრიფცია

ხმა-ხმაზე სისტემებშიც კი ჩვეულებრივ გჭირდებათ ტრანსკრიპტი განხილვისთვის, QA-სთვის და CRM შენიშვნებისთვის. ჯაჭვური მილსადენები ტრანსკრიპტს პირველხარისხოვან ეტაპად აქცევს. ხმა-ხმაზე სისტემებს იმავე მიზეზით სჭირდება აშკარა აღების გზა.

რეკომენდაცია: შეინახეთ გაწმენდილი ტრანსკრიპტი, ნდობის ან გაურკვევლობის სიგნალები თუ ხელმისაწვდომია, ენა და დროის ნიშნულები ხელსაწყოების გამოძახებებთან გასწორებული. ნუ მოეპყრობით ტრანსკრიპტს როგორც იურიდიულ სიმართლეს შენახვისა და წვდომის პოლიტიკის გარეშე.

იდენტობა, ხელსაწყოები და ნებართვები

ხმოვანი აგენტი, რომელსაც შეუძლია „ყველაფერი, რაც მხარდაჭერის ანგარიშს შეუძლია“, საწარმოოდ მზად არ არის.

აგენტების ძირითადი სახელმძღვანელო კვლავ მოქმედებს: მოდელები, ხელსაწყოები და ინსტრუქციები, ადამიანის ჩარევით ჩავარდნის ზღვრების შემდეგ და მაღალრისკიან მოქმედებებამდე (OpenAI practical guide to building agents). ხმოვანი აგენტის დოკუმენტაცია აშკარად უკავშირებს ხელსაწყოებს, გადაცემებს, დამცავ ბარიერებსა და ადამიანის განხილვას ისევე, როგორც ტექსტურ აგენტებს (OpenAI voice agents, guardrails and human review).

რეკომენდაცია:

  • დაადასტურეთ იდენტობა ანგარიშისპეციფიკურ პასუხებამდე (მხოლოდ დამრეკავის ID სუსტია მაღალრისკიანი მოქმედებებისთვის);
  • გამოიყენეთ მინიმალური პრივილეგიის ხელსაწყოების ფარგლები და ნებადართულთა სიები (უსაფრთხო ხელსაწყოების გამოძახება ბიზნეს აგენტებისთვის);
  • გამოყავით კითხვის ხელსაწყოები ჩაწერის ხელსაწყოებისგან;
  • მოითხოვეთ ადამიანის დამტკიცება ფულადი მოძრაობისთვის, იურიდიული ვალდებულებებისთვის, ანგარიშის ხელში ჩაგდების აღდგენისთვის და შეუქცევადი გაუქმებებისთვის (ადამიანი ციკლში AI აგენტები);
  • მიეცით აგენტს მანქანური იდენტობა როტაციით, აუდიტითა და ავარიული გამორთვით, არა გაზიარებული თანამშრომლის პაროლი.

გამოთქმული ხელსაწყოების გამოყენება გამჭვირვალე უნდა დარჩეს, როცა ლოდინი ხდება. OpenAI-ს რეალური დროის ხმოვანი პროდუქტის შენიშვნები აღწერს პარალელურ ხელსაწყოების გამოძახებებსა და გასაგონ სტატუსის ფრაზებს, მაგალითად კალენდრის შემოწმებას, სანამ სამუშაო გრძელდება (OpenAI voice models announcement). მოეპყარით ამას როგორც UX ნიმუშს, არა მტკიცებულებას, რომ ყოველი მომწოდებელი კარგად ახორციელებს.

იყიდეთ, ააშენეთ ან მოიყვანეთ საწარმოო პარტნიორი

გამოიყენეთ მართვადი ხმოვანი პროდუქტი, როცა სამუშაო პროცესი ერგება მის ჩაშენებულ ინტეგრაციებს, დამტკიცების მოდელს, ტრანსკრიპტის კონტროლსა და გადაცემის ქცევას მორგებული ორკესტრაციის გარეშე. ეს ხშირად ყველაზე სწრაფი შესაბამისობაა ვიწრო რეცეპციის, მარშრუტიზაციის ან ხშირად დასმული კითხვების პილოტისთვის, სადაც პლატფორმა უკვე ხსნის საჭირო სატელეფონო და CRM გზებს.

ააშენეთ მორგებული ორკესტრაციის ფენა, როცა იდენტობა, ხელსაწყოების პოლიტიკა, ბიზნესწესები, დანერგვის საზღვარი ან შეფასება მნიშვნელოვნად უნდა განსხვავდებოდეს პროდუქტის ნაგულისხმევებისგან. მორგებული სამუშაო გამართლებულია კონტროლის მოთხოვნებით, არა ტელეფონიის ინფრასტრუქტურის ხელახალი აშენების სურვილით.

მოიყვანეთ საწარმოო პარტნიორი, როცა რთული ნაწილი მოიცავს სამუშაო პროცესის დიზაინს, ხელსაწყოების ნებართვებს, თანხმობისა და შენახვის გადაწყვეტილებებს, ჩავარდნის ტესტირებასა და დანერგვის პასუხისმგებლობას რამდენიმე სისტემაზე. პარტნიორმა უნდა დატოვოს დაკვირვებადი მტკიცებულება და ოპერაციული გადაცემა, არა მხოლოდ დამაჯერებელი ხმოვანი დემო.

ხარჯის ფაქტორები, რომლებიც მოითხოვეთ ხელმოწერამდე

ნუ შეადარებთ მომწოდებლებს ერთი რეკლამირებული წუთობრივი რიცხვით. მოითხოვეთ სრული ხარჯის მოდელი ტელეფონიის ტრანსპორტისთვის, მეტყველების ამოცნობისთვის, მეტყველების გენერაციისთვის, მოდელის დასკვნისთვის, პარალელური სესიებისთვის, ნომრის იჯარისთვის, ჩანაწერებისა და ტრანსკრიპტებისთვის, ხელსაწყოების გამოძახებებისთვის, ადამიანზე გადაცემისთვის, QA განხილვისთვის, მხარდაჭერისა და მინიმალური ვალდებულებებისთვის.

ასევე მოდელირეთ ჩავარდნილი ზარები და ადამიანური გასუფთავება. უფრო იაფი წუთი შეიძლება უფრო ძვირი დაჯდეს, როცა დაყოვნება იწვევს განმეორებით ზარებს, გადაცემები კარგავს კონტექსტს, ან ხელმძღვანელები ყოველ შემთხვევას უნდა აღადგენდნენ.

პარტნიორის შეფასებისთვის ხმოვანი არხის მიღმა გამოიყენეთ როგორ ავირჩიოთ საწარმოო AI აგენტის პარტნიორი.

ჩაწერა, თანხმობა და გამავალი ზარების წესები

ეს სექცია არ არის იურიდიული რჩევა და არ არის უნივერსალური. წესები განსხვავდება ქვეყნების, აშშ-ის შტატების, ინდუსტრიისა და ზარის ტიპის მიხედვით. ჩართეთ იურისტი თქვენი იურისდიქციებისთვის ჩაწერამდე ან AI ხმოვანი გამავალი ზარების განთავსებამდე.

ჩაწერა

ტელეფონიის პროვაიდერები აფრთხილებენ, რომ ჩაწერა საჭიროებს თანხმობის კანონებთან შესაბამისობას და რომ პრაქტიკა განსხვავდება იურისდიქციებზე (მაგალითებია California's Invasion of Privacy Act და მსგავსი კანონები სხვაგან) (Twilio Record legal notice). Twilio-ს შესაბამისობის სტატია ამბობს, რომ საუკეთესო პრაქტიკაა ყველაზე მკაცრი მოქმედი თანხმობის წესების დაცვა და თანხმობის მიღება ყველა მონაწილისგან ჩაწერამდე (Twilio legal considerations for recording).

რეკომენდაცია:

  • გადაწყვიტეთ, ჩაწერთ თუ არა აუდიოს, შეინახავთ ტრანსკრიპტებს, თუ ორივეს;
  • გაამჟღავნეთ ჩაწერა და AI დახმარება, სადაც საჭიროა ან სადაც ბრენდის პოლიტიკა მოითხოვს;
  • დააფიქსირეთ შენახვის ვადა, წვდომის როლები და წაშლის პროცესი პილოტის ტრაფიკამდე;
  • ამოიღეთ გადახდის მონაცემები და სახელმწიფო იდენტიფიკატორები ჟურნალებიდან, სადაც შესაძლებელია.

გამავალი AI ხმა (აშშ-ის TCPA მაგალითი)

შეერთებულ შტატებში FCC-ის Declaratory Ruling FCC 24-17 (გამოქვეყნებული 2024 წლის 8 თებერვალს) ადასტურებს, რომ TCPA შეზღუდვები „ხელოვნურ ან წინასწარ ჩაწერილ ხმაზე“ მოიცავს AI ტექნოლოგიებს, რომლებიც ადამიანის ხმებს აგენერირებენ, ამიტომ დაფარული ზარები ზოგადად საჭიროებენ გამოძახებული მხარის წინასწარ აშკარა თანხმობას, თუ არ არის საგანგებო მიზანი ან გამონაკლისი (FCC 24-17 PDF).

ეს გადაწყვეტილება აშშ-ის TCPA წერტილია. სხვა ქვეყნები ავტომატურ და მარკეტინგულ ზარებს სხვა კანონებით არეგულირებენ. ნუ დააკოპირებთ აშშ-ის თანხმობის ფორმას სხვა ბაზარზე და ნუ ჩათვლით საქმეს დასრულებულად.

რეკომენდაცია: გამავალ AI ხმას მოეპყარით როგორც ცალკე პილოტს შემომავალი ხშირად დასმული კითხვებისგან, თანხმობის რეესტრით, მშვიდი საათებით, უარის დამუშავებითა და მკაცრი გაჩერებით სადავო ან გაბრაზებულ პასუხებზე.

ესკალაცია, სათადარიგო გზა და კონტექსტით გადაცემა

საწარმოო ხმის დიზაინი ვარაუდობს, რომ აგენტი საჯაროდ ჩავარდება.

დააპროექტეთ სამი გამოსავალი:

  1. პოლიტიკის ესკალაცია - მოთხოვნა ფარგლებს გარეთაა ან მაღალი რისკის.
  2. ნდობის ესკალაცია - ტრანსკრიფცია, იდენტობა ან ამოღება ძალიან სუსტია უსაფრთხო გაგრძელებისთვის.
  3. სისტემის სათადარიგო გზა - მოდელის, STT, TTS ან ტელეფონიის პროვაიდერის შეცდომები; რიგი ადამიანზე ან სტრუქტურირებული უკუზარი.

კონტექსტით გადაცემამ უნდა გადასცეს კომპაქტური პაკეტი: დადასტურებული იდენტობის მდგომარეობა, განზრახვა, უკვე ცდილი ხელსაწყოები, ტრანსკრიპტის შეჯამება და აკრძალული შემდეგი მოქმედებები. ჩატისებური გადაცემის ნიმუშები კვლავ ეხმარება; იხილეთ პრინციპები ადამიანზე გადაცემის დიზაინში, თუნდაც ტრანსპორტი ტელეფონი იყოს, არა Telegram.

რეკომენდაცია: არასოდეს დაასრულოთ ჩავარდნილი ზარი სიჩუმით ან უსასრულო ციკლით „ვერ გავიგე“. შეთავაზეთ ადამიანის გზა, უკუზარი ან მკაფიო გაჩერება.

დაკვირვებადობა და პილოტის გაზომვა

NIST-ის AI Risk Management Framework ნებაყოფლობითია, მაგრამ სასარგებლო ენაა ოპერატორებისთვის: განსაზღვრეთ როლები ადამიანი-AI კონფიგურაციებისთვის, გაზომეთ და მონიტორინგი გაუკეთეთ სისტემებს, და გახსოვდეთ, რომ ადამიანები შეიძლება ზედმეტად ენდონ ავტომატიზებულ ქცევას (NIST AI RMF 1.0, NIST AI RMF hub).

ხმის სპეციფიკური სიგნალები ლოგისთვის:

  • სესიისა და ზარის ID-ები;
  • ნაბიჯის დროის ნიშნულები და შეწყვეტის მოვლენები;
  • ტრანსკრიპტი პლუს გაწმენდის ნიშნები;
  • ხელსაწყოს სახელი, არგუმენტები (გაწმენდილი), შედეგის სტატუსი;
  • ესკალაციის მიზეზის კოდები;
  • გადაცემის შედეგი;
  • მოდელის, ინსტრუქციისა და ხელსაწყოს სქემის ვერსიები;
  • პროვაიდერის შეცდომის კოდები.

ზოგადი საწარმოო ლოგირების სქემისთვის იხილეთ აგენტის დაკვირვებადობა: ჟურნალები, კვალები და შენახვა.

პილოტის შეფასების ბარათი (განსაზღვრეთ საკუთარი ზღვრები)

მაჩვენებელირატომ მნიშვნელოვანიაროგორ განიხილოთ
დავალების დასრულება შეზღუდულ სამუშაო პროცესზედაასრულდა თუ არა პილოტის სამუშაო ფარული ადამიანური გასუფთავების გარეშე?შერჩეული ზარები + სისტემის სიმართლე
იძულებითი ესკალაციის წილიაგენტი ძალიან ფრთხილია, ძალიან თამამი, თუ კარგად კონტროლდება?მიზეზის კოდების ჰისტოგრამა
გადაცემის პაკეტის სისრულეშეუძლია თუ არა ადამიანს გაგრძელება მომრეკავის ხელახალი დაკითხვის გარეშე?ხელმძღვანელის ჩეკლისტი
დაბლოკილი უნებართვო ხელსაწყოების მცდელობებინებართვები რეალურია?უსაფრთხოების / ხელსაწყოს აუდიტის ჟურნალი
შეწყვეტის ხარისხისაუბრის შეწყვეტა ძალიან გვიან, ძალიან ადრე, თუ ხმაურზე ჭრის?მონიშნული შეწყვეტის ნიმუშები
იდენტობის ჩავარდნებიარასწორი პირის რისკიშეუსაბამობისა და მრავალი დამთხვევის შემთხვევები
თანხმობის / გამჟღავნების დეფექტებიჩაწერისა და გამავალი ზარების შესაბამისობაიურიდიული + ოპერაციული ორმაგი განხილვა
დრო პირველ აუდიომდე / დრო გადაწყვეტამდედაყოვნება და პროცესის წევაინსტრუმენტაცია, არა ანეკდოტები

გაუშვით ოქროს ნაკრები სატელეფონო სცენარებისა და საწინააღმდეგო შემთხვევების გაშვებამდე. გამოიყენეთ მეთოდი როგორ შევაფასოთ AI აგენტები გაშვებამდე. ამჯობინეთ ჩრდილოვანი ან შეზღუდული ეტაპობრივი საცდელი ტრაფიკი სრულ DID (ტელეფონის ნომერი) გადართვამდე (ჩრდილოვანი რეჟიმი და ეტაპობრივი საცდელი გაშვება AI აგენტებისთვის).

ნუ გამოაქვეყნებთ საჩვენებელ „შეკავების“ პროცენტებს იმის განსაზღვრის გარეშე, რას ნიშნავს შეკავება და ვინ აკეთებდა გასუფთავებას ზარის შემდეგ.

ჩავარდნის რეჟიმები

ეს რეჟიმები მეორდება საწარმოო ხმოვან სისტემებში. უფრო ფართო აგენტის ჩავარდნების კატალოგისთვის იხილეთ საწარმოო აგენტის ჩავარდნის რეჟიმები.

ჩავარდნის რეჟიმირას განიცდის მომრეკავიდიზაინის კონტროლი
დემოს დონის დაყოვნებაგრძელი მკვდარი ჰაერი ყოველი ნაბიჯის შემდეგგაზომეთ თავიდან ბოლომდე; შეამცირეთ მსჯელობა მარტივ ნაბიჯებზე; გაუშვით სტატუსის მეტყველება ნაკადად
საუბარში შეწყვეტის გარეშემომრეკავი ლაპარაკობს მონოლოგზე, რომელიც გრძელდებაჩართეთ შეწყვეტა; გაასუფთავეთ დაკვრის ბუფერები; შეკვეცეთ ისტორია გაგონილ აუდიომდე
ცრუ შეწყვეტებიაგენტი ჩერდება ხმაურზე ან „აჰა“-ზეადაპტური შეწყვეტა ან ზღვრები; ცრუ შეწყვეტაზე გაგრძელების პოლიტიკა
ჰალუცინირებული პოლიტიკათავდაჯერებულად არასწორი საათები, ფასი ან სამედიცინო რჩევადააფუძნეთ პასუხები; უარი წყაროების გარეშე; ესკალაცია
ზედმეტად პრივილეგირებული ხელსაწყოებიაგენტი შემთხვევით ჯავშნის, აბრუნებს თანხას ან ცვლის ანგარიშის მდგომარეობასნებადართულთა სიები, ჩაწერის კარიბჭეები, ადამიანის დამტკიცება
სუსტი იდენტობაანგარიშის მონაცემები წაკითხულია არასწორი პირისთვისგაძლიერებული ვერიფიკაცია მგრძნობიარე კითხვამდე
ჩუმი გადაცემის ჩავარდნა„გთხოვთ დაელოდოთ“ სამუდამოდაკონტროლეთ რიგის მდგომარეობა; გამოაცხადეთ სათადარიგო გზა; შეთავაზეთ უკუზარი
ჩაწერა თანხმობის გზის გარეშეიურიდიული და ბრენდის რისკიიურისდიქციის განხილვა; გამჟღავნება; შენახვის პოლიტიკა
გამავალი თანხმობის გარეშემარეგულირებელი და საჩივრის რისკითანხმობის რეესტრი; TCPA კლასის შემოწმებები სადაც გამოიყენება
უპატრონო ინსტრუქციებიქცევა დრეიფობს „პატარა“ რედაქტირების შემდეგდაავერსიოთ ინსტრუქციები და ხელსაწყოები; ეტაპობრივი საცდელი გაშვება; დასახელებული პასუხისმგებელი

ანტი-ნიმუშები:

  • ხმოვანი მომწოდებლის ყიდვა, რადგან დემო სახალისო იყო, სამუშაო პროცესის რუკის გარეშე;
  • სრული ავტომატური დაჯავშნითა და გადახდებით დაწყება;
  • პრეტენზია, რომ სისტემა სატელეფონო ცენტრის გუნდს ჩაანაცვლებს;
  • ტრანსკრიპტის განხილვის გამოტოვება, რადგან „ხმა კარგად ჟღერდა“;
  • ერთი გაზიარებული ადმინისტრატორის სერთიფიკატი ყოველი ხელსაწყოსთვის.

ხშირად დასმული კითხვები

გვჭირდება ხმა-ხმაზე, თუ STT პლუს TTS საკმარისია?

ორივე შეიძლება იმუშაოს. ხმა-ხმაზე ჩვეულებრივ უკეთესია ბუნებრივი შეწყვეტისა და დაბალი პირველი აუდიოს დაყოვნებისთვის. ჯაჭვური STT-LLM-TTS ხშირად უკეთესია, როცა გჭირდებათ მკაცრი შუალედური შემოწმებები, მდგრადი ტექსტური ეტაპები ან არსებული ტექსტური აგენტის ხელახალი გამოყენება (OpenAI voice agents). აირჩიეთ კონტროლის საჭიროებების მიხედვით, არა მარკეტინგული ეტიკეტების.

უნდა თუ არა ხმოვანმა აგენტმა გაამჟღავნოს, რომ AI არის?

ხშირად დიახ ბრენდისა და ნდობის პოლიტიკად, და ზოგჯერ დიახ იურიდიულ ან სახელშეკრულებო მოთხოვნად. წესები განსხვავდება იურისდიქციისა და ინდუსტრიის მიხედვით. ჩაშენეთ გამჟღავნება გახსნის ნაბიჯსა და ჩაწერის შეტყობინებაში, არა მიამაგროთ საჩივრის შემდეგ.

რამდენად დიდი უნდა იყოს პირველი პილოტი?

რეკომენდაცია: ერთი სამუშაო პროცესი, ერთი ენა, ერთი ხაზი ან რიგი, ფიქსირებული განხილვის ფანჯარა და დასახელებული პასუხისმგებელი. გააფართოვეთ მხოლოდ მას შემდეგ, რაც შეფასების ბარათი რეალურ ტრაფიკზე გაივლის, არა შიდა დემო დღის შემდეგ.

შემდეგი ნაბიჯი Dali-სთან

თუ გინდათ საწარმოო ხმოვანი პილოტი და არა კიდევ ერთი გაპრიალებული დემო, მოიტანეთ ერთი სატელეფონო სამუშაო პროცესი, ჩაწერისა და თანხმობის პოლიტიკის მონახაზი თქვენი იურისდიქციებისთვის, და დასახელებული ოპერაციული პასუხისმგებელი.

Dali დაგეხმარებათ მართვის ციკლის, ხელსაწყოების ნებართვების, ესკალაციის პაკეტისა და შეფასების ჩარჩოს რუკირებაში სრული ნომრის გადართვამდე.

დაჯავშნეთ შეზღუდული ხმოვანი აგენტის პილოტის დიზაინის სესია უკვე ჩაწერილი სამუშაო პროცესითა და შეზღუდვებით.