ЦКМ · направление

Голос — это не только тембр

Когда мы говорим «улучшить голос бота», обычно имеем в виду записать голос покрасивее. Но клиент слышит не тембр, а весь речевой тракт: как бот произносит числа, где делает паузы, как быстро отвечает, замолкает ли, когда его перебили. Новый голос сам по себе не чинит ничего из этого списка. Здесь — карта того, из чего складывается речевой опыт и на что мы можем влиять.

Материал к обсуждению · август 2026 6 рычагов сейчас + 1 горизонт Термины даны с расшифровкой, внизу словарик
Как устроен один ход разговора сегодня
01
Клиент говорит
Телефонная линия, 8 кГц — узкая полоса, верхние частоты срезаны
02
Понять, что он закончил
Пауза — это конец мысли или человек думает?
03
Распознать речь
Аудио превращается в текст
04
GigaChat думает
Промпт, функции, выбор ветки сценария
05
Озвучить ответ
Текст превращается в звук: тембр, интонация, паузы
06
Клиент слышит
И решает, слушать дальше или бросить трубку

Слово «голос» обычно относят только к шагу 05. А ощущение робота может создавать и то, что происходит на шагах 02 и 04: бот долго молчит, не замолкает, когда его перебили, или принимает «угу» за реплику. Что именно весит больше у нас — как раз и надо замерить. Поэтому направление правильнее называть не «новый голос», а качество речевого взаимодействия.

Что предлагаю согласовать

Если обсуждение уйдёт вглубь — вот четыре решения, ради которых всё это собрано.

  1. С БРГИ — быстро сравнить операторские голоса и стили, которые уже доступны, не дожидаясь записи собственного
  2. С GigaVoice — снять базовые задержки по участкам и разобраться с перебиваниями
  3. У себя — собрать корпус из 50–100 реплик и наладить слепые сравнения
  4. С командой Капитанова — предложить отдельную встречу и наш бот как кандидата на пилот full-duplex; для нас это пока гипотеза, которую надо обсудить

Мы здесь не с нуля

Дефекты копятся с весны, и часть из них переезжала из версии в версию. Летом остаток B2C-обзвона откладывали в ожидании следующей версии ради улучшения перебиваний — это было ожиданием, а не подтверждённым результатом. То есть стратегию «подождём следующую версию» уже пробовали, и вопрос она не закрыла.

Что наблюдали в разные моменты — часть уже правили, что-то встречается редко, что-то живо до сих пор. Список нужен не как отчёт о текущем состоянии, а чтобы видеть масштаб темы.

ложные перебивания на шум, вздох, «угу» не замолкает, когда его реально перебили после перебивания в контекст попадает вся реплика «вас не слышно» ошибки ударений смена громкости и интонации внутри разговора металлическое звучание «алло» одним голосом, разговор другим паузы по 10–15 секунд проговаривание названий функций двойное прощание или прощание без отбоя

Часть уже разбирали: смотрели логи IVR и GigaVoice, пробовали менять скорость речи. Но измеримого улучшения ни по одному заходу зафиксировано не было — именно поэтому нужны базовый замер и единый формат дефектов.

От «хочется поестественнее» — к работе

«Голос неестественный» — это ощущение, а не задача. С такой формулировкой смежники отвечают ровно то, что уже отвечали: без прослушивания прокомментировать нечего. Задача появляется тогда, когда у претензии есть адрес.

Начать стоит с того, что «естественностью» называют три разные вещи — с разными владельцами и разными способами починки.

Тембр Как звучит голос сам по себе, независимо от того, что произносит. Меняется выбором голоса.
Манера Темп, паузы, куда падает ударение, слышен ли вопрос вопросом. Зависит и от голоса, и от нашего текста, и от доступных настроек.
Поведение в разговоре Когда вступает, когда молчит, замолкает ли, если его перебили. К синтезу отношения почти не имеет.

Отсюда первый шаг — не выбрать рычаг, а разложить претензии на конкретные: запись, таймкод, одна фраза о том, что именно не так. «Здесь ударение в фамилии», «здесь пауза на четыре секунды», «здесь оборвал на полуслове» — у каждого такого дефекта есть адрес, а у «неестественно» адреса нет.

И это уже сработало. Ровно один раз претензию сформулировали точнее обычного — «звучит менее живо, чем в рознице» — и ответ пришёл сразу и по делу: технология одна, разница в технике записи, а наш голос вообще не рекомендован для разговоров с клиентами. Одна точная формулировка сэкономила месяцы обсуждений.

Карта ниже нужна именно для этого: чтобы каждому дефекту было куда лечь.

Шесть рычагов, которые работают уже сейчас

Каждый можно улучшать независимо от остальных. Два из шести — подготовка текста и замеры качества — целиком в нашей зоне и не требуют ничьих доработок; ещё по нескольким мы можем как минимум начать измерять. Метки «наша зона» и «смежники» ниже — рабочая гипотеза: точная граница между настройками GigaVoice, сценарием в SkillFlow и деревом IVR как раз предстоит установить.

01

Сам голос

Как звучит тембр: живо или по-дикторски, приятно или «петушино».

TTS — text-to-speech, синтез речи: превращение текста в звук.

voice model — голосовая модель, конкретный голос в каталоге.

fine-tuning — дообучение модели под нового диктора.

Одно сравнение уже было. В августе прогнали текущий голос против альтернативного из каталога на одном демодиалоге, на телефонных 8 кГц. Альтернативный нескольким показался живее и легче по интонации, но, возможно, хуже ставит ударения; оба остались явно синтетическими, решение не приняли. Одного диалога для вывода мало — нужен слепой тест на нормальном наборе реплик.
Про запись клиентских менеджеров. Записи КМов полезны в двух разных ролях, и их стоит различать. Первая — эталон операторской манеры: где пауза, где ударение, какой темп. Вторая — материал для создания или адаптации конкретного голоса. Требования к записи, объём и сроки сильно зависят от того, какой путь выбран.
И искать их не с нуля. Записи разговоров менеджеров уже хранятся в системе речевой аналитики: можно отобрать по оргструктуре или табельному номеру, посмотреть и выгрузить. То есть эталон стиля — сильных продавцов — доступен уже сейчас, ещё до всяких разговоров про запись нового голоса.
Часть ответов у нас уже есть. Отдельных «технологий B2B и B2C» не существует — синтез один. Разница в том, как записывали голоса: для розничного контура записывали операторов колл-центра прямо в диалоге с клиентом, поэтому речь ближе к живому сотруднику. Мы же используем голос в режиме свободной речи, и его как раз не рекомендуют для разговоров с клиентами — он ведёт себя слишком живо.
Есть названный кандидат, и он уже подключён на тесте. Нам порекомендовали вариант того же диктора в более спокойной подаче, ближе к операторской. Послушали — звучит интереснее. Доступ на тестовом стенде прописали, переключение пока упирается в техническую мелочь. То есть первый шаг — не запись своего голоса, а довести до конца замену на уже одобренный вариант и сравнить вслепую.
Важно про границы: собственный голос уже ведётся отдельным треком со своими владельцами. Здесь мы не переоткрываем эту тему, а собираем карту и то, что можно улучшить, не дожидаясь нового голоса. Смена голоса в любом случае требует сохранённого базового варианта и быстрого отката, а платный голос — согласования с владельцами каталога.
каталог голосовтест и предложение — за нами
02

Интонация и паузы

Одна и та же фраза может прозвучать как живой вопрос, как чтение с листа или как допрос. Тембр при этом одинаковый.

prosody — просодия: интонация, логические ударения, темп, длина пауз. Всё, кроме собственно тембра.

SSML — язык разметки речи: теги, которыми можно вручную задать паузу, ударение или темп.

Чем это отличается от предыдущего пункта. Хорошо записанный операторский голос уже несёт в себе манеру — поэтому 01 и 02 частично перекрываются, и удачная замена голоса действительно улучшает обе вещи разом. Но голос задаёт манеру «по умолчанию» и ничего не знает про нашу конкретную фразу: куда падает логическое ударение, как читается редкая фамилия, сколько держать паузу перед вопросом. Наш нынешний голос — самый живой из имеющихся, и именно поэтому не рекомендован для клиентских разговоров: манера не та. Хороший голос поднимает планку, но вопрос не закрывает.
Наш пример: «Скажите, пожалуйста, остались ли у вас вопросы?» должно звучать вопросом, а не концом перечисления. И «СОТРУДНИКАМ» с неверным логическим ударением выдаёт робота сильнее, чем неидеальный тембр.
Ключевой вопрос к БРГИ: можно ли задавать стиль описанием — «спокойный менеджер, деловой исходящий звонок», — а не размечать теги в каждой реплике? Реплики генерирует модель на лету, размечать их вручную невозможно.
GigaVoice
03

Что мы отдаём в синтез

Качество звучания зависит не только от модели, но и от текста, который до неё доходит. Существенная часть «роботизированности» рождается не в синтезе, а в том, что мы ему отдаём.

text normalization — нормализация: превращение цифр, сокращений и символов в произносимую форму.

lexicon — словарь произношений и ударений для имён, брендов и терминов.

Наши больные места: «0321» рискует прочитаться как «ноль тысяч триста двадцать один»; «до 5 %», «п.п.», «СберБизнес», «ИП». И ударение в имени и отчестве клиента — ошибка здесь особенно заметна в первые секунды исходящего звонка.
Плюс сам синтаксис реплик. Синтез спотыкается о книжные обороты. «Спасибо, что, будучи премиальным клиентом, вы активно используете…» — две запятые подряд дают две паузы и фраза хромает. Переход к коротким фразам устного строя — быстрый эксперимент, который можно поставить без единого обращения к смежникам.
целиком наша зона
04

Скорость ответа

Клиент договорил — и тишина. После заметной паузы даже хороший голос воспринимается как робот.

latency — задержка.

time-to-first-audio — время до первого звука: главная метрика, а не скорость синтеза сама по себе.

streaming — потоковый синтез: начинать говорить, не дожидаясь, пока модель допишет весь ответ.

p50 / p95 — медиана и «худшие 5 % случаев». Мерить надо оба: средним по больнице задержка не описывается.

Мерить надо по участкам: конец речи клиента → распознавание → первый токен модели → первый звук синтеза. Клиент воспринимает всё это как «бот тупит», хотя причина может быть вообще не в синтезе.
Известное нам ограничение. В нашем контуре один ход GigaChat 3 — это либо текстовая реплика, либо вызов функции; выдать клиенту текст перед вызовом в том же ходе нельзя. Значит, сама модель фразу «секундочку, проверяю» произнести не может.
Но у GigaVoice заполнитель есть. В настройках, которые мы отправляем в GigaVoice, лежит готовый механизм: список коротких фраз вроде «минуту», «сейчас проверим», «давайте посмотрим» и правило, по каким функциям их проигрывать. Значит, вопрос не «дайте нам заполнитель», а «как он настроен, срабатывает ли и почему отдельный флаг долгого ожидания выключен».
Почему это не академический вопрос. По зарплатному проекту все знания о продукте помещаются в промпт. На следующих продуктах так не выйдет: понадобится функция поиска по базе знаний. А раз бот не может сказать «секундочку, ищу», эта функция обязана отвечать быстро — иначе клиент будет слушать тишину на каждом вопросе. Ограничение напрямую задаёт требования к архитектуре базы знаний.
GigaVoiceзамеры — за нами
05

Перебивания и очерёдность

Живой разговор — не рация. Человек говорит «угу», кашляет, задумывается, перебивает на середине фразы.

VAD — voice activity detection: определение, говорит человек или это шум.

barge-in — перебивание: возможность клиента оборвать речь бота, и способность бота при этом быстро замолчать.

endpointing — определение конца реплики: клиент закончил мысль или взял паузу?

backchannel — «угу», «ага», «понятно»: знак «я слушаю», а не попытка забрать слово.

Что ломается: бот не замолкает, когда его перебили; считает «угу» репликой; после перебивания начинает фразу сначала. И отдельно наблюдали, что после перебивания бот ведёт себя так, будто договорил инструкцию до конца.
Здесь есть расхождение, которое стоит закрыть. На прямой вопрос команда GigaVoice ответила, что в историю уходит только та часть реплики, которую успели озвучить, а не весь сгенерированный текст. Значит, наблюдаемое поведение объясняется чем-то другим — и разбирать это надо на конкретной записи, а не по памяти.
Часть рычагов у нас уже есть. В настройках передаётся список фраз, которые не считать перехватом хода — туда уже входят «алло», «угу», «ок», «ладно», «плохо слышно». Есть и блокировка перебивания на время исполнения функции. То есть ложные срабатывания на «угу» — не только чужая зона: это ещё и вопрос, правильно ли заполнен наш собственный список.
GigaVoice
06

Как понять, что стало лучше

«На слух приятнее» — не результат. Без замера мы не отличим улучшение от привыкания.

A/B — слепое сравнение двух вариантов, когда слушатель не знает, где какой.

MOS — mean opinion score: средняя оценка естественности по шкале от 1 до 5.

WER — word error rate: доля ошибок распознавания. Дешёвая автоматическая проверка разборчивости и произношения — удобно гонять на каждой правке. Человеческую оценку естественности не заменяет: голос может отлично распознаваться и при этом звучать деревянно.

Как делать: взять 50–100 реальных реплик нашего сценария, озвучить каждым кандидатом, сравнить вслепую через телефонный тракт, а не в браузере. Голос, красивый в вебе, на 8 кГц звучит иначе.
Слушать всё руками не придётся. Акустику и часть речевых дефектов умеют оценивать модели — как это устроить и где остаётся человек, разобрано отдельным блоком ниже.
Первые 10 секунд считать отдельным срезом. На холодном звонке решение «слушать или бросить» принимается рано — насколько рано именно у нас, стоит проверить по своим данным. И поверх всего — бизнес-метрика: доля сбросов в первые 10 секунд и доля дошедших до вопроса о сотрудниках.
целиком наша зона

Сквозная оговорка: всё слушаем через телефон

Текущий рантайм работает на телефонных 8 кГц и другого режима не поддерживает — это уже проверено на августовском сравнении голосов. Узкая полоса срезает верхние частоты, поэтому сравнивать голоса, интонацию и произношение имеет смысл только через реальный звонок: демо-страница вендора в браузере ничего не доказывает. Открытый вопрос — только про целевой контур: останется ли он узкополосным.

Чей это дефект

Много споров возникает из-за того, что непонятно, куда нести проблему. Первичное правило простое.

Воспроизводится в нашем прогоне на том же контексте Если тот же дефект вылезает, когда мы гоняем промпт и функции из ноутбука напрямую через модель, — причина в промпте или в GigaChat. Это наша зона.
Появляется только в звонке Сначала смотрим голосовой слой: GigaVoice и IVR.
В любом случае Это только первичная сортировка. Вывод требует аудио, расшифровки, стенда, версий и конфигурации — без этого спор упрётся во впечатления.

И здесь есть отдельная сложность: наши локальные прогоны не воспроизводят реальный звонок. В ноутбуке мы отдаём промпт и функции прямо модели и смотрим ответ. В звонке тот же промпт живёт внутри голосового контура, который добавляет к нему свой системный слой и преобразует текст перед синтезом — что именно, мы не знаем.

Отсюда два следствия. Локальный регресс, каким бы хорошим он ни был, не может быть единственным приёмочным контуром: часть поведения он просто не видит. И вопрос «что голосовой контур добавляет к нашему промпту и делает с нашим текстом» — один из первых к владельцам GigaVoice.

Оценивать может не только человек

Прослушивать сотни записей вручную не получится, да и не нужно. Оценку стоит разложить на три слоя и оставить человека там, где без него действительно нельзя.

Акустика — считают модели Есть отдельные модели предсказания качества речи: слушают аудио и выдают оценку естественности, шумности, разрывов, скачков громкости. Эталонная запись не нужна, разворачиваются локально.
Интонация и перебивания — аудио-модель как судья Современные модели принимают звук напрямую и отвечают на узкие вопросы: перебил ли бот клиента, есть ли неуместная пауза, звучит ли вопрос вопросом. Спрашивать надо бинарно, а не «оцени голос от 1 до 10» — так оценки заметно стабильнее.
Всё считаемое — из логов Задержки, длительность тишины, момент перебивания, фактически проговорённая часть реплики, повтор фразы. Это арифметика, а не суждение, и отдавать её модели незачем.

Как это завести. Разметить вручную небольшую выборку, прогнать те же записи через автоматических судей и посчитать совпадение отдельно по каждому критерию. Где совпадение высокое — перебивания, паузы, темп — метрику можно автоматизировать. Где низкое — «приятность голоса», тонкие оттенки — оставить человеку. Дальше автоматика ловит регрессии на каждом релизе, а человек принимает решение по выбору голоса.

Две оговорки, без которых это не заработает. Записи реальных клиентских звонков за периметр банка не уходят — значит либо внутренние аудио-модели, либо локально разворачиваемые оценщики. Для сравнения голосов это не помеха: наш тестовый корпус состоит из синтезированных реплик, клиентских данных в них нет.

И любого такого судью надо калибровать на русской речи и на телефонных 8 кГц: оценщик, обученный на широкополосном английском, о нашем звонке скажет мало. Плюс проверить лицензии — часть открытых моделей качества речи разрешена только для некоммерческого использования.

Горизонт: full-duplex

Это отдельный архитектурный трек, который может потребовать глубокой перестройки текущего тракта. Его стоит вести параллельно улучшению текущего тракта, а не вместо него.

новое поколение

Подход Сбера: одна модель вместо цепочки из трёх

Сегодня работает конвейер: одна нейросеть переводит речь в текст, вторая придумывает ответ, третья озвучивает. Все по очереди — человек сказал, ИИ подумал, ИИ ответил. Full-duplex — это когда система слушает и говорит одновременно, как человек в телефонном разговоре: продолжает воспринимать речь собеседника, пока говорит сама. Технически так можно сделать и потоковым каскадом, но Сбер публично описывает свой подход именно как одну модель вместо трёх.

Почему смотрим сейчас: Сбер публично подтвердил разработку full-duplex: одновременно слушать и говорить. По приведённой РБК оценке технология сокращает задержку с нескольких секунд до порядка 160–320 мс — это про full-duplex вообще, а не обещанный показатель конкретной модели. В мире похожее уже есть: Moshi (Kyutai, 2024), Gemini Live, GPT-Live. Решение «Яндекса» позволяет перебить ассистента, но ждёт смены реплики — это ещё не полный дуплекс. РБК, со слов Сергея Маркова, директора по развитию технологий ИИ Сбербанка. Судя по публичному описанию команд, разработку ведёт подразделение мультимодального ИИ. Речевая команда, с которой мы работаем по синтезу, по этому проекту деталей не имеет — у них свой трек по речь-в-речь. Это ещё один довод выходить на них напрямую, а не через смежников.
Целевые эффекты для нашего бота
  • Скорость реакции близко к человеческой
  • Короткая пауза не считается концом реплики
  • «Угу» отличается от настоящего перебивания
  • Бот замолкает, когда клиент реально начал говорить
  • После перебивания продолжает с нужного места, а не с начала

Это то, ради чего технология делается, а не измеренные свойства будущей модели. Архитектура даёт возможность — качество всё равно определяется реализацией и проверяется тестами.

Чего не решит — и что добавит
  • Неверную ветку сценария и неверный код завершения
  • Выдуманные условия по тарифам
  • Перегруженный текст и слабый сценарий продажи
  • Отсутствие тестов
  • Новый риск: начать говорить, не дослушав важное — например «только больше не звоните»
Главный вопрос к команде — не про красоту голоса. Наш бот должен не только разговаривать, но и надёжно фиксировать итог: вызвать функцию завершения, выбрать правильный код, оформить СМС или перезвон, мгновенно прекратить речь по стоп-сигналу. Значит, спрашивать надо: есть ли у модели отдельный канал действий; можно ли вызвать функцию, не проговаривая её; как быстро обрывается звук; сохраняется ли выбранная ветка после перебивания; можно ли потом восстановить, что клиент реально услышал.
С чем к ним идти. Не с запросом «дайте нам модель», а так: у нас есть работающий банковский голосовой агент со строгими развилками, функциями, записями реальных звонков и собственным тестовым контуром. Это готовый отраслевой сценарий для пилота — сложный разговор с бизнес-целью и стоп-условиями, а не свободный чат.

Что можем сами, а что нужно просить

Практический смысл карты: несколько направлений можно начать двигать уже на этой неделе, не дожидаясь чужих доработок.

Что мы уже передаём в GigaVoice

Речевой контур не чёрный ящик: заметная часть поведения настраивается прямо в вызове, который отправляем мы. Это самый конкретный ответ на вопрос «на что мы вообще можем влиять».

фразы, которые не считать перехватом хода: «алло», «угу», «ок», «ладно», «плохо слышно» что говорить, если клиент молчит заполнители на время работы функции по каким именно функциям их проигрывать отдельный флаг фразы при долгом ожидании блокировка перебивания на время исполнения функции скорость синтеза речи модель распознавания модель и параметры генерации
делаем сами

Наша зона

  • Текст под озвучку. Короткие фразы устного строя, без причастных оборотов
  • Числа, коды и бренды. 0321, проценты, сокращения, названия продуктов
  • Ударения в именах. Особенно критично для первого впечатления
  • Тестовый корпус. 50–100 реплик нашего сценария для слепых сравнений
  • Замеры задержек по участкам и отнесение дефектов к нужному слою
  • Настройки, которые уходят в GigaVoice: список игнорируемых фраз, заполнители, скорость синтеза, поведение при молчании — всё это в нашем вызове
  • Голосовое поведение в промпте: кто говорит финальную фразу, нет ли двойного прощания, согласованы ли приветствие и основная часть
  • Завершение звонка как контракт: одно прощание, один вызов функции, реальный отбой, сохранённый код итога и ни слова служебного текста — всё это проверяется по отдельности
просим у смежников

GigaVoice, SkillFlow, IVR

По синтезу речи картина уже понятна: есть продакт-оунер синтеза, есть команда, принимающая разбор дефектов озвучивания и интонации, и есть те, кто выдаёт доступы и держит стенды. Контакты по всем трём ролям у нас есть. Не закрыта граница между настройками самого голосового движка, скрытым промптом голосового слоя, конфигурацией сценария в SkillFlow и деревом IVR. ЦП ИИ — это research и работа над критериями качества, а не владелец голосового контура.

  • Каталог голосов: что доступно нам и на каких условиях
  • Управление стилем: можно ли задавать манеру описанием, а не тегами
  • Словарь ударений и поддержка разметки произношения
  • Потоковый синтез и возможность оборвать уже начатую речь
  • Что из настроек реально работает на проме, а что осталось стендовым
  • Чувствительность перебивания к шуму и скорость остановки речи — то, чего в наших параметрах нет
  • Фильтр служебной разметки перед озвучкой — чтобы клиент никогда не услышал технический текст, что бы ни попало в ответ модели
  • Что рантайм делает с нашим текстом: есть ли собственный системный промпт голосового слоя и преобразования перед синтезом — они могут объяснять, почему поведение в звонке отличается от наших локальных прогонов
  • Дефекты озвучивания идут как инциденты, а не как пожелания в бэклог: заполненный шаблон плюс выгрузка аудио по сессии, задача в трекере, дубль письмом. Под этот формат и надо собирать материал сразу
  • Требования к записи нового голоса: часы, студия, формат, сроки, цена

Что предлагаю сделать

Порядок важен: сначала понять, что именно портит восприятие сегодня, и только потом вкладываться в дорогое.

Снять базовый уровень

Собрать 50–100 реплик нашего сценария плюс десяток коротких диалогов с типичными проблемами. Озвучить, послушать через телефон, зафиксировать: естественность, произношение, задержки, поведение при перебивании. Это точка отсчёта, без неё все дальнейшие сравнения бессмысленны.

Разобрать тракт по владельцам

Вместе с владельцами GigaVoice и SkillFlow понять, кто отвечает за синтез, интонацию, нормализацию, перебивания и задержки. Сейчас организационная картина размытая, и это само по себе тормозит.

Выбрать три параллельных эксперимента

Голос и стиль из того, что уже доступно; нормализация текста и произношение; задержки и перебивания. Каждый меряется отдельно, чтобы не смешивать эффекты.

Завести единый формат дефектов

На каждый дефект — аудио, расшифровка, стенд, версии и конфигурация. Считать частоту, а не обсуждать единичные впечатления. Заодно это то, в каком виде смежники готовы принимать от нас баги.

Отдельно зайти к команде full-duplex

Не ждать готового продукта, а предложить наш сценарий как площадку для пилота и заранее выяснить, как в их архитектуре уживаются речь и вызов функций.

Словарик

Сначала — кто есть кто в тракте звонка, потом речевые термины, которые будут звучать на встречах со смежниками.

GigaVoice
Голосовой движок: превращает речь в текст и текст в речь, решает, когда клиент закончил говорить и считать ли его слова перебиванием. Сюда же относятся заполнители и скорость синтеза.
SkillFlow
Где лежит сценарий и наш промпт. Это боевой путь: именно отсюда идут реальные звонки, а не тестовая песочница.
IVR / Smart IVR
Канал самого разговора: принимает и ведёт звонок, по добавочному номеру выбирает нужный сценарий, произносит финальную фразу и кладёт трубку.
GigaChat
Языковая модель, которая по нашему промпту решает, что сказать и какую функцию вызвать. К звучанию отношения не имеет.
TTS
Text-to-speech, синтез речи. Превращение текста в звук.
ASR
Automatic speech recognition, распознавание речи. Обратная операция: звук в текст.
prosody · просодия
Интонация, логические ударения, темп и паузы — всё, что делает речь живой, кроме самого тембра.
SSML
Язык разметки речи. Теги, которыми можно вручную задать паузу, ударение, темп или высоту голоса.
text normalization
Приведение текста к произносимому виду: числа, проценты, даты, сокращения, номера телефонов.
lexicon · словарь произношений
Список слов с заданным произношением и ударением: имена, бренды, термины.
VAD
Voice activity detection. Определяет, говорит ли человек или это шум, кашель, кондиционер.
barge-in · перебивание
Клиент начинает говорить поверх бота. Бот должен быстро замолчать — и знать, что его оборвали.
endpointing
Определение конца реплики клиента. Пауза — это конец мысли или человек думает?
backchannel
«Угу», «ага», «понятно». Знак «я слушаю», а не попытка забрать слово.
latency · задержка
Время от конца речи клиента до первого звука ответа. Главная метрика скорости.
streaming · потоковый синтез
Начинать озвучивать, не дожидаясь, пока модель допишет ответ целиком.
p50 / p95
Медиана и «худшие 5 % случаев». По среднему задержку оценивать нельзя.
MOS
Mean opinion score. Средняя оценка естественности речи по шкале от 1 до 5, выставленная слушателями.
WER
Word error rate, доля ошибок распознавания. Дешёвый способ проверить разборчивость синтеза.
full-duplex
Режим, в котором система слушает и говорит одновременно, а не по очереди. Противоположность — half-duplex, «рация».
turn-taking · очерёдность
Правила передачи хода в разговоре: кто говорит сейчас и когда можно вступить.
8 кГц
Частота дискретизации телефонного тракта, на котором работает наш рантайм. Узкая полоса, верхние частоты срезаны — поэтому голос по телефону звучит не так, как в браузере.