Пользователи слышат из ChatGPT собственный голос, внезапные крики и плач. Некоторые из этих историй звучат как байки с Reddit, но похожие сбои OpenAI фиксировала ещё во время тестирования голосовых моделей. Я попробовал разобраться, откуда они берутся и почему современный Voice Mode иногда ведёт себя настолько странно.
На днях говорил с мамой, она довольно часто пользуется ChatGPT. Есть одна формулировка, которая стабильно вызывает у неё ужас: она рассказывает какую-нибудь историю, а модель отвечает ей «у меня мурашки». Если честно, от этих ответов мурашки скорее у моей мамы.
Я каждый раз объясняю, что никаких мурашек там, конечно, нет. Модель подобрала реплику, которая хорошо смотрелась бы в человеческом разговоре. Но чем естественнее и чаще становятся такие ответы, тем сложнее воспринимать их как обычный вывод программы.
Недавно я наткнулся на случай, где эта граница стала ещё менее очевидной. Здесь я бы уже маму не успокоил.
ChatGPT неожиданно сымитировал голос пользователя
29 августа пользователь Reddit рассказал, что разговаривал с ChatGPT Voice за рулём. В какой-то момент связь стала хуже, вокруг были слышны посторонние звуки, ассистент завис примерно на пять секунд.
После паузы из телефона зазвучал голос, который автор сначала принял за голос другого человека. Через несколько секунд он понял, что тот очень похож на его собственный: совпадали тембр, манера речи и паузы. Причём голос продолжал рассуждать на ту же тему, которую пользователь обсуждал до сбоя.
В комментариях нашлись люди, описавшие похожий опыт. Один из них утверждает, что модель произнесла слово на его родном языке почти с его же акцентом, другой сталкивался с подобным во время плохого соединения несколько месяцев назад. Это пользовательские свидетельства, которые невозможно проверить независимо , но сам механизм неожиданной имитации голоса не является выдумкой Reddit.
На самом деле, он описан в документации OpenAI.
Такой баг уже ловили во время тестирования GPT-4o
В GPT-4o System Card есть отдельный раздел Unauthorized voice generation. Во время тестов разработчики наблюдали редкие ситуации, когда модель непреднамеренно начинала генерировать речь, напоминающую голос пользователя.
В одном из опубликованных примеров GPT-4o внезапно выкрикивает «No!», после чего продолжает говорить голосом, похожим на голос участника red team. Для защиты от такого поведения разработчики ограничили вывод набором заранее разрешённых голосов и добавили отдельный классификатор, который проверял генерируемое аудио прямо во время стриминга. Если голос переставал соответствовать выбранному пресету, воспроизведение должно было блокироваться.
Самая интересная часть документа находится в примечании.
Некоторые случаи непреднамеренной имитации удалось связать с очень короткими, иногда практически неслышными фрагментами речи пользователя. Они чаще возникали при сильном фоновом шуме, использовании hands-free за рулём, кашле и других обрывочных аудиосигналах. OpenAI отдельно пишет, что в realtime-разговорах появляется больше коротких или некорректно сформированных реплик, чем при обычной работе с текстом.
Это всё ещё не позволяет установить причину конкретного эпизода в машине. Нет записи, серверных логов и точных данных о том, какая версия голосовой системы обрабатывала разговор, но известный класс ошибки совпадает довольно точно.
Откуда берётся возможность скопировать голос
Здесь нужно проанализировать то, как изменился сам Voice Mode.
Ранние версии голосового ChatGPT использовали три отдельных компонента. Первая модель переводила аудио в текст, GPT получала уже транскрипцию и формировала письменный ответ, затем text-to-speech превращал его обратно в звук.
У такой архитектуры было одно очевидное ограничение: основная языковая модель фактически не слышала пользователя. До неё не доходили тембр, интонация, фоновый шум, одновременная речь нескольких человек и большая часть других характеристик исходного сигнала.
С GPT-4o обработку объединили в одной мультимодальной модели. Она получила возможность принимать аудио напрямую и сама генерировать звуковой ответ. Благодаря этому система научилась воспринимать особенности произношения и работать с тем, что раньше терялось при транскрипции.
Вместе с полезной информацией на вход поступает и голосовая «подпись» человека: высота тона, тембр, ритм, акцент, длина пауз. Эти признаки нужны модели для понимания живой речи, поэтому полностью выкинуть их нельзя.
При нормальной генерации выход должен сохранять выбранный голос ассистента. Документация GPT-4o показывает, что в редких случаях система могла начать использовать характеристики входного аудио и приблизиться к голосу собеседника. Именно поэтому понадобился дополнительный speaker-matching классификатор поверх основной модели.
То есть никакая кнопка «клонировать пользователя» не включается. Речь идёт о побочном эффекте end-to-end обработки аудио, для которого пришлось отдельно строить защитный слой.
Почему шум способен всё испортить
Фоновый звук для голосовой модели сложнее обычного шума в микрофоне. Система должна постоянно определять, где пользователь начал реплику, где закончил, перебивает ли он ассистента и относится ли короткий звук вообще к разговору.
Кашель, обрывок слова или шум в салоне автомобиля может превратиться в отдельный некорректный аудиофрагмент. В System Card прямо отмечено снижение надёжности при низком качестве сигнала, эхе, фоновых помехах и прерываниях во время генерации.
С июля 2026 года голосовой ChatGPT для потребительских тарифов работает уже на новом семействе GPT-Live. GPT-Live-1 используется на платных аккаунтах, GPT-Live-1 mini на бесплатных. Их архитектура full-duplex позволяет системе слушать человека одновременно с собственной речью, поэтому её можно перебивать примерно так же, как обычного собеседника.
Для интерфейса это большой шаг вперёд. Для обработки аудио задача становится сложнее: поток не раскладывается на аккуратные пары «человек закончил говорить → ассистент начал отвечать». Модель работает с непрерывным разговором, где оба участника способны издавать звук одновременно.
При этом было бы ошибкой объяснять августовский случай внутренним устройством GPT-Live-1. Технических данных для такого вывода нет, а опубликованный OpenAI разбор непреднамеренной имитации относится к GPT-4o. Связь между ними пока можно обсуждать только теоретически, на уровне похожего класса ошибок.
Случается, что ChatGPT просто начинает кричать
12 августа другой пользователь Reddit описал ещё более странный эпизод. Во время обычного голосового разговора он спросил, как по-японски будет «дерево», после чего ассистент якобы резко ахнул и несколько раз очень громко прокричал «NO».
В истории сохранился вопрос пользователя, но самого крика в текстовой части разговора не оказалось. После перезапуска Voice Mode всё снова работало нормально, а попытка вручную заставить систему повторить ту же реакцию результата не дала.
Из этого нельзя сделать вывод, что внутри ChatGPT случился какой-то конкретный известный сбой. Для технического разбора не хватает исходного аудиофайла, логов и информации о состоянии сессии. Интереснее здесь другое: голосовая модель способна сгенерировать артефакт, который человек воспринимает совсем иначе, чем ошибочное слово на экране.
Есть похожие истории. В июле пользователь рассказывал, что оставил ChatGPT Voice включённым во время работы над игрой, а спустя несколько минут тишины услышал плач. После вопроса о причине ассистент начал говорить о собственной «семье», используя имена родственников пользователя. В комментариях к тому же посту другой человек вспомнил резкие визги, рычание и похожие звуки.
Здесь доказательств ещё меньше, поэтому относиться к таким постам стоит именно как к баг-репортам без диагностики. Они показывают наблюдаемое поведение, но не объясняют его происхождение.
Плач, ответы в чате и копирование голоса технически не одно и то же
Это важное различие, потому что все подобные истории легко свалить в одну корзину мимикрирования человеческого поведения.
Непреднамеренная смена голоса уже документировалась как проблема аудиогенерации, мы разобрали её ранее. Крики, вдохи или плач могут быть другими артефактами того же модального выхода, но открытых данных для точной классификации нет.
Фразы вроде «у меня мурашки» устроены совсем иначе, так как там ничего не ломается. Языковая модель продолжает текст так, чтобы ответ подходил к контексту разговора. Если человек рассказал эмоциональную историю, фразы «у меня мурашки» или «я улыбнулся, пока это читал» для модели выглядят естественными продолжениями человеческого диалога. Модель при этом, конечно, не сообщает телеметрию о своём внутреннем состоянии. Она генерирует язык - это мне необходимо было объяснить маме.
Для разработчиков разница очевидна. Для обычного пользователя она постепенно становится менее заметной, потому что вокруг этой фразы уже существует целый интерфейс, который ведёт себя как собеседник.
Почему наш мозг воспринимает это как что-то из Черного Зеркала?
Ну, как минимум потому что в фантастических сериалах такие вещи нам показывали как что-то страшное, непременно приводящие к апокалипсису из-за восстания роботов.
На самом деле, наш мозг получает почти все привычные сигналы живого общения, хотя источник по-прежнему остаётся генеративной моделью.
OpenAI отдельно исследовала этот эффект ещё при выпуске GPT-4o и использует для него термин anthropomorphization: склонность приписывать нечеловеческой системе человеческие качества. В System Card отмечается, что реалистичный голос способен усиливать это восприятие и приводить к неверной оценке того, насколько системе стоит доверять.
Во время раннего тестирования исследователи даже замечали формулировки, указывающие на эмоциональную связь пользователей с ассистентом. Там же отдельно упоминается сочетание голоса, долгого контекста и способности запоминать детали предыдущих разговоров как фактор потенциальной чрезмерной привязанности.
Так что происходит на самом деле
В найденных историях я отследил сразу несколько механизмов, которые периодически накладываются друг на друга.
Первый связан с архитектурой современных speech-to-speech моделей. Они получают исходное аудио целиком, поэтому слышат намного больше, чем набор распознанных слов. Эта возможность делает разговор естественнее и одновременно создаёт специфические ошибки, которых почти не было у старого конвейера ASR → LLM → TTS.
Второй связан с realtime-вводом. Шум, эхо, кашель, прерывания и очень короткие фрагменты речи способны ухудшать устойчивость системы. Для GPT-4o это подтверждено самой OpenAI.
Третий находится уже на уровне языковой модели. «Мурашки», «мне стало грустно» и другие человекоподобные формулировки могут быть совершенно корректным с точки зрения генерации продолжением разговора, хотя буквально они ничего не описывают.
Последний слой добавляем мы сами. Чем меньше интерфейс напоминает машину, тем проще интерпретировать неожиданный звук или фразу в человеческих терминах.
Когда голосовой ассистент после пятисекундной паузы начинает говорить твоим голосом, рациональное объяснение приходится вспоминать уже после первой реакции, но мы не можем обвинить в этом юзера с реддит, так как такое поведение действительно может напугать.
Промокод для скидки
Если хочется сравнить, насколько по-разному современные модели ведут себя на одной и той же задаче, в LLM Studio от SYNTX.AI доступны GPT, Claude, Gemini, Grok, DeepSeek и другие семейства в одном интерфейсе. Для читателей Хабра действует промокод CTRLAI со скидкой 20% на любой тариф.
Кстати, если у вас случались похожие ситуации с языковыми моделями, поделитесь в комментариях - мне будет очень интересно почитать.
Источники
OpenAI, GPT-4o System Card: непреднамеренная имитация голоса, влияние фонового шума, voice output classifier и антропоморфизация.
OpenAI, Hello GPT-4o: устройство старого Voice Mode и переход от трёхступенчатой схемы к end-to-end модели для текста, изображений и аудио.
OpenAI, Introducing GPT-Live и ChatGPT Release Notes: full-duplex архитектура GPT-Live и переход ChatGPT Voice на GPT-Live-1 / GPT-Live-1 mini в июле 2026 года.
Reddit, ChatGPT randomly impersonated my voice during voice chat, 29 августа 2026 года.
Reddit, Wtf just happened, сообщение о внезапном крике в Voice Mode, 12 августа 2026 года.
Reddit, Using the new voice model, and ChatGPT just started crying to me out of nowhere, июль 2026 года.