Как распознать аудио, сгенерированное ИИ
Только 54 процента россиян верно отличают сгенерированные нейросетью голосовые сообщения от реальных. Таким результатом опроса поделилась частная маркетинговая компания. При этом распознать ИИ в текстах и видеороликах смогли три четверти опрошенных, именно аудиозаписи оказались настоящим «слепым пятном».
Однажды вечером москвичка Елизавета Бердяева получила необычное сообщение. Ее знакомая напомнила ей о долге, который Елизавета должна была ей вернуть.
— Сумма была на самом деле небольшая, только вот никаких денег я не занимала, — рассказывает Елизавета. — В результате разъяснений мне отправили голосовое сообщение, которое до этого получила знакомая с моего аккаунта. Неизвестный мне человек, но с моим голосом, просил у нее денег в долг.
Что Елизавета, что ее знакомая стали жертвами мошенника и в первые столкнулись с совершенно новой гранью использования искусственного интеллекта: генерация аудиозаписей и подражание голосу реального человека.
Область, покрытая мраком
Контент, сгенерированный нейросетью, уже давно стал обыденностью. Кто-то до сих пор упорно находит признаки почерка ИИ в изображениях и видео, но смысл остается один — такое количество «нечеловеческого» замыливает глаз и начинает восприниматься привычным. Лучше всего аудитория считывает признаки ИИ в видео — 77 процентов верных ответов.
По словам участников исследования, авторство нейросетей выдают нарушения физики и логики. Текст же расположился на втором месте: сообщения в мессенджере от лица «живого человека» вычислили 82 процента — участники называли в числе машинных примет избыточную вежливость и идеальное оформление.
Сложнее обстоит дело с информационными статьями: с ними не справились уже 40 процентов респондентов — в таких текстах, как отмечали участники, ИИ прячется за обобщениями, а человека выдает способность к самокритике и иронии. Однако самой настоящей «слепой зоной» оказался звук, а именно — сгенерированные голосовые сообщения.
— Искусственный интеллект не придумывает голос с нуля, он учится на огромных массивах записей человеческой речи. Во время обучения модель анализирует тысячи часов аудио, например, произношение звуков, интонацию, темп, паузы, эмоциональную окраску, особенности дыхания и множество других параметров. Затем она выявляет закономерности и учится воспроизводить речь, которая звучит естественно для человека, — объясняет эксперт в программировании, создании нейросетей и ботов Никита Войтов. — Создать голос, который полностью не похож ни на один существующий, теоретически возможно. Однако любая модель обучается на человеческих голосах, поэтому отдельные характеристики неизбежно будут пересекаться с реальными людьми.
При этом современные технологии позволяют настолько сильно изменять тембр, высоту и манеру речи, что вероятность случайного совпадения с конкретным человеком крайне мала. Гораздо чаще злоумышленники, наоборот, специально копируют голос определенного человека, используя всего несколько минут его записей.
По словам Никиты Войтова, универсальных признаков, по которым можно безошибочно определить голос, созданный нейросетью, сегодня практически не существует.
— Еще несколько лет назад синтетическая речь часто звучала слишком ровно, с неестественными паузами или неправильными ударениями. Сейчас лучшие модели умеют воспроизводить эмоции, интонацию и даже небольшие несовершенства живой речи. Поэтому человеку становится все сложнее отличить подделку только на слух, — говорит эксперт.
Если сравнивать с текстом, то нейросетевой голос сегодня определить все сложнее: в статье или сообщении ИИ все еще может выдать себя чрезмерной структурированностью, повторяющимися конструкциями или отсутствием индивидуального стиля. Качественный синтез речи способен практически полностью имитировать особенности живого человека. По словам Войтова, именно поэтому все большее значение приобретают не попытки «услышать» подделку, а технические методы проверки происхождения аудиозаписей.
Не замена, а коллега
Сегодня синтез голоса активно используют при создании рекламных роликов, подкастов, аудиокниг, обучающих курсов, корпоративного контента и прочего.
— Главная причина — это не стремление заменить человека, а возможность быстрее, дешевле и гибче производить контент, — объясняет маркетолог Василий Михайлов. — Если раньше любая правка текста требовала повторной записи с диктором, то сегодня ее можно внести за считаные минуты, а один и тот же материал легко адаптировать под разные аудитории, языки или регионы.
При этом, по его словам, говорить о полной замене профессиональных актеров озвучки пока нельзя.
— Там, где важны эмоции, доверие, харизма и индивидуальная подача, живой голос остается незаменимым, — подчеркивает маркетолог. — Скорее рынок движется к разделению ролей: нейросети берут на себя массовую и техническую озвучку, а люди — проекты, где голос является частью бренда и эмоциональной коммуникации.
То, что сегодня лишь немногим больше половины россиян способны отличить сгенерированный голос от настоящего, открывает новые возможности для бизнеса и ускоряет производство контента. С другой стороны, это повышает риски мошенничества и манипуляций. Поэтому, по словам Михайлова, с развитием технологий должна расти и цифровая грамотность пользователей: важно не только уметь пользоваться ИИ, но и критически оценивать аудиосообщения — особенно те, которые содержат нетипичные просьбы.
ПРЯМАЯ РЕЧЬ
Евгения Лютова, психолог:
— Уже известно, что в стрессе и при ЧС люди склонны больше доверять голосовым помощникам: настолько безэмоционально и четко они диктуют алгоритмы действий. Человек уже перестал отличать нейроконтент от авторского. Если автор обучил модель на собственном стиле — отличить от человека ее публикацию не получится.
КСТАТИ
Доля рекламных бюджетов, полностью управляемых ИИ, составила 85 процентов. Нейросети оптимизируют 40 процентов рекламных кампаний и генерируют почти каждый третий баннер. Также они создают рекламные тексты у 65 процентов пользователей популярного российского поисковика.