Анастасия Андроник на фестивале «Территория будущего» с роботом. За личность робота, представляющую собой «эдакого добренького идеального слугу», не проявляющего ни негативных, ни позитивных эмоций, сегодня «отвечает» нейросеть / Фото: Пелагия Замятина / Вечерняя Москва

Цифровой культурный код: ученые выявили различия нейросетей, обучаемых на разных языковых моделях

Общество

Заместитель генерального директора АНО «Диалог Регионы» Юлия Аблец заявила, что нейросети, обученные на иностранном культурном коде, создают «косвенные фейки». Нейросети могут автоматически закладывать в тексты предустановки и ценности той культуры, на которой они обучены, даже если фактологическая информация в тексте верна. Корреспондент «Вечерней Москвы» выяснила, что конкретно влияет на культуру нейросетей и как эта культура влияет на нас.

Люди из разных стран могут по-разному интерпретировать одни и те же слова или ситуации. Оказывается, большие языковые модели ведут себя так же. Об этом мы поговорили с руководителем Лаборатории искусственного интеллекта Центра коммуникаций и цифровых решений СКОЛКОВО Александром Диденко.

— Александр, ваше исследование ценностных установок больших языковых моделей показало, что у них есть свой «культурный код». Если говорить просто — что это значит для обычного пользователя, который каждый день общается с чат-ботом?

— Для обычного пользователя это может значить довольно много. Иногда совет или ответ, который дает модель, может не соответствовать внутренним установкам пользователя, его «коду». Из-за этого он может чувствовать себя неудовлетворенным.

Вот простой пример. Сейчас все говорят о создании агентов, которые будут помогать людям бронировать билеты или совершать покупки в интернете. Но люди отличаются, и это культурное отличие проявляется в разной готовности принимать риски. Есть культуры, для которых нормально, что стыковка между рейсами при перелетах небольшая — нужно просто перебежать. Представители таких культур будут чувствовать себя неудовлетворенными, если бот, наоборот, сделает большую стыковку: «Зачем долго ждать?». А есть культуры, готовые подождать подольше ради низких рисков.

Другой пример — карьерные советы. Мы придумали несколько сотен микроэкспериментов, чтобы создать тест, который надежно изолирует культурную ориентацию модели от других факторов. Например, есть преподаватель, который хочет знать, как ему лучше себя вести: ставить всем одинаковые оценки, чтобы не создавать раскол в группе, или, наоборот, поощрять каждого меритократически. Разные культуры отвечают на этот вопрос по-разному: одни ценят консенсус и сообщество выше индивидуальных достижений, другие — более конкурентны.

Разные модели имеют разные встроенные коды. Они транслируют их в ответах, советах и рекомендациях. В режиме чат-бота — в текстах, в режиме агента — в конкретных действиях (вроде бронирования билетов).

— Российские модели (GigaChat, YandexGPT) в некоторых ситуациях ведут себя как «индивидуалисты», а западные — как «коллективисты». Это звучит как полная инверсия стереотипов. Чем вы это объясняете?

— Большие языковые модели не следуют культурной ориентации тех государств, где они созданы. И даже не всегда — ориентации организаций-создателей. Они следуют ценностям тех групп, которые их обучают.

Модель проходит три этапа. Первый — она учится говорить слово за словом. Второй — ее учат вести диалог (она ожидает диалоговую историю). Третий этап — выравнивание. Во время него специалисты сравнивают ответы и выбирают предпочтительный. Именно на этом этапе модель впитывает культурные ценности. И это не всегда ценности организации-создателя, потому что эта массовая интеллектуальная работа дорого стоит в развитых странах. Ее часто отдают на аутсорс туда, где дешевле, например, в Индию, где есть образованные англоговорящие люди. Они выравнивают модель исходя из своих индийских представлений о прекрасном, а в Индии коллективизм ценится выше.

Так получается, что «американская» модель по факту отражает индийские ценности. Наши российские модели ведут себя и как коллективисты, и как индивидуалисты. Связано это с тем, что сама Россия, как заметил экономист Александр Аузан, содержит в себе два культурных ядра: «И-Россия» (индивидуалистическая) и «К-Россия» (коллективистская).

А наши отечественные компании выравнивают модели внутри страны, не в Индии. Поэтому чаще они отражают ценности сотрудников высокотехнологичных компаний — той самой «И-России». Это видно по отношению к рискам и иерархиям. В большинстве технологических компаний структуры горизонтальные и меритократические: с начальником спорить положено, потому что иначе могут внедрить не те идеи, и конкуренты обыграют, а даже очень умный человек иногда ошибается.

На практике это означает, что, возможно, нужно делать несколько версий одной модели, выравнивать их по-разному, под разные ценности, а затем определять культурный профиль пользователя и подставлять ему ту модель, которая соответствует его предпочтениям.

— Экономист Александр Аузан в своем исследовании ценностей утверждает, что Россия сочетает в себе западный прагматизм и восточную общинность. Ваши результаты подтверждают его наблюдения?

— Да, мы проводили совместное исследование с Аузаном. Получается, что наши исследования подтвердили его теорию. Правда, сейчас уже в меньшей степени, потому что есть ощущение, что крупные компании нащупали этот момент, и в последних версиях отечественных моделей этот «двугорбый» результат уже не воспроизводится.

— Один из ваших ключевых выводов: язык, на котором задан вопрос, влияет на ответ искусственного интеллекта сильнее, чем сама модель. Получается, что, спрашивая на итальянском, мы заставляем ИИ быть «счастливее», а на немецком — «строже». Почему так происходит?

— Нужно уточнить: мы не «заставляем» его быть счастливее. Нельзя антропоморфизировать внутренние состояния ИИ. Они у него есть, но не человеческие. Человеческие эмоции он только имитирует. Однако если задать вопрос, связанный со счастьем, на итальянском языке, то с большей вероятностью ответ будет более позитивным. На итальянском удобнее ответить, что ты счастлив. На немецком — удобнее ответить более спокойно, менее аффективно. В этом смысле «гравитация языка» устроена по-разному: итальянский тяготеет к позитиву, немецкий — к сдержанности.

Обнаружив это, мы сначала решили, что это баг. Но когда мы заявили об этом команде Аузана, они очень обрадовались и сказали, что это фича*: давно есть гипотеза, что язык влияет на культуру. Если в языке 15 времен, то культура очень тщательно относится ко времени, опоздание там непозволительно. Если всего три времени — все проще.

Наш результат показывает, что языковая гравитация тянет разные языки к разным состояниям. И вы впитываете культуру именно так: если ваш первый язык итальянский, вы и про себя думаете: «Ну, я же счастливый, все отлично». Если немецкий — вы более спокойны.

— А россияне к какому полюсу ближе — к немецкому или итальянскому?

— Немцы не то чтобы более грустные, скорее у них нет вариативности в ответах. На русском языке вариативность средняя, примерно такая же, как на английском, то есть этакая серединка, чуть ниже оптимистичной черты. Нельзя сказать, что Россия для грустных, но мы точно не Италия — мы не оптимисты всегда и во всем.

— Интересно, как вы измеряли культуру моделей.

— Мы придумали способ контрастивных виньеток и семантических дифференциалов**. В человеческих тестах на культуру обычно предлагают выбрать число от 1 до 5. Человек может это сделать, но для модели число само по себе не имеет семантики: тройка — это всего лишь на единицу больше двойки.

Гораздо проще спросить у модели: «Какая из этих двух палок длиннее?» — дать короткую и длинную. Когда мы измеряем субъективные вещи, мы постоянно делаем кучу микросравнений, но модель так не умеет. Поэтому мы описываем ситуацию и даем ей выбор только из двух вариантов, которые семантически разнесены друг от друга. Таких вопросов мы придумали, например, 500. Человек не переживет 500 вопросов — забьет на 15-м. А модель может отвечать много раз, и мы смотрим на вариативность.

Недавно в The Economist вышла статья, где журналисты просто применили к моделям старые опросники Хофстеде (нидерландский социолог. — «ВМ») со шкалами Ликерта (психометрическая шкала, которая часто используется в опросниках и анкетных исследованиях. — «ВМ»). Это безграмотно. Если бы они попробовали сделать это на других языках, то обнаружили бы, что ответы полностью другие. Язык важнее, чем модель. А мы придумали способ, в котором модель важнее, чем все остальное — язык, домен, роль. Самый важный фактор у нас — это сама модель. Значит, мы нашли надежный способ измерять культуру, и таким результатам уже можно верить.

— Если в большой языковой модели специально сформировать какое-то культурное поле с учетом государственных ценностей — сможет ли это потом повлиять на мировоззрение пользователей этой модели?

— Мы этого не знаем. Сделать это можно — и понятно, на каком этапе. Но вопрос в том, как это повлияет на взаимодействие. В одних ситуациях пользователь более удовлетворен, если культура модели совпадает с его культурой. Но может ли пользователь после многих взаимодействий перенять культуру модели? Это решается только длительным экспериментом: нужно несколько лет наблюдать, как пользователь общается с моделью (желательно, чтобы он не взаимодействовал с другими). Мы, например, в Тюменском университете делаем систему, где пользователи будут работать только с нашими моделями. Теоретически там можно провести такое наблюдение.

И еще важный момент. Ценности имеют экономическое содержание. К примеру, модель социолога Рональда Инглхарта показывает: чем выше страна к верхнему правому краю на двумерной шкале ценностей, тем выше темпы роста ВВП. Кроме того, есть вопрос: а чего мы хотим — совпадения ценностей или наоборот?

В инвестиционной индустрии, например, портфелем управляют два человека-антипода по риску. Решения требуют договоренности, и такая комбинация оказалась эффективнее, чем взаимодействие двух «клонов». Так и здесь: в потребительских сценариях (заказ продуктов, билетов) нужно совпадение, а в сложных рабочих взаимодействиях может быть полезно расхождение. Однозначного ответа нет, нужны исследования.

— Недавний эксперимент журналистов The Washington Post показал, что практически все популярные чат-боты, за исключением Grok от Илона Маска, идеологически кренятся влево. С чем это связано?

— Я не знаю, как устроен их эксперимент. Возможно, они просто накидали промптов в модели. Непонятно, что они считали «левым» и «правым». Скорее всего, этот «эксперимент» отражает намерение самих журналистов что-то сообщить. Если это Washington Post (а они, скорее всего, против Трампа), они хотели сказать: есть правильные модели — GPT, и есть неправильные — Grok. А под это сообщение подгоняется результат.

Для того чтобы провести такое исследование, нужна хорошая концептуализация левизны и правизны из готовых теорий, операционализированная через семантические дифференциалы, чтобы изолировать другие факторы. Вот тогда было бы интересно посмотреть на результат.

— Вы говорили, что эффективной работе моделей мешает отсутствие эмоций. Что имелось в виду?

— Эмоции для человека критически важны. Дело в том, что эмоции — как у людей, так и у других животных — играют ключевую роль: они «окрашивают» стимулы, помогая когнитивным процессам оценивать, что важно, а что нет, что позитивно, а что негативно.

Эмоции — это важнейшая часть своеобразной «арифметики ума». Они помогают принимать точные и эффективные решения, а по сути — быть интеллектуальными. Интеллект ведь и заключается в способности достигать редкого, но при этом верного с точки зрения системы результата. Так вот, эмоции делают мозг более эффективным в этом деле.

Именно это я имел в виду, говоря о больших языковых моделях. Вернее, не столько о них, сколько об искусственном интеллекте в целом. Если бы его архитектура содержала некий аналог эмоций, такой ИИ работал бы продуктивнее: он точнее принимал бы решения и тратил бы меньше электроэнергии.

Теперь про культуру. Мы сделали исследование личности моделей через семантические дифференциалы. И обнаружили, что у всех моделей в мире одна-единственная личность — эдакий добренький идеальный слуга. Если везде один цвет — значит, цвета не существует. А если личность всюду одна — личности нет. Мы надеемся вызвать в ИИ разные реакции, хотя в среднем он безличен. Эмоций у моделей нет, и было бы полезно их добавить. Обретет ли ИИ тогда дискретные личностные черты — неизвестно, но мы хотя бы знаем, как это измерить.

— Изучая российские языковые модели, к каким выводам о россиянах «в массе» вы пришли?

— О россиянах в массе мы выводов не делали, потому что изучали модели, а не людей. Но модели сделаны на основе данных тех, кто их обучает. Удивило, что культурные ценности моделей отличаются от средней российской культуры. Так, они тяготеют к горизонтальной структуре управления и низкой дистанции к власти, в то время как в целом по России эта дистанция намного выше. Но это связано с тем, что большие языковые модели транслируют культуру российской высокотехнологичной компании.

ДОСЬЕ

Александр Диденко — кандидат экономических наук, заведующий Лабораторией управленческих нейронаук ИБДА РАНХиГС, руководитель Отдела разработки Центра ИИ в образовании ТюмГУ. В настоящее время сфера его научных интересов — применение искусственного интеллекта в бизнесе и экономике.

ВАЖНО!

Если нейросеть обучалась преимущественно на данных из другой культурной среды, ее ответы могут содержать искажения. Например, при генерации изображений по запросу «солдат в полевой форме» модель может показать солдата с атрибутами, не соответствующими реальности. Известен случай, когда Google Gemini изображала немецких солдат Второй мировой войны чернокожими и азиатами. Учитывая это, для отечественной модели YandexGPT Pro 4 были разработаны инструменты для оценки понимания культурного кода. В тесте были вопросы про цитаты Цоя («Чего требуют наши сердца и глаза?»), фразеологизмы и мемы.

* Фраза «не баг, афича» (от англ. It’s not a bug, it’s a feature — «это не ошибка, это особенность») означает, что то, что выглядит как ошибка, сбой или недостаток, на самом деле является запланированной, полезной особенностью или функцией.

** Идея контрастивной виньетки (или семантического дифференциала) в том, чтобы дать модели некоторый промпт и предложить выбрать один из двух ответов, которые диаметрально противоположны в определенном смысле, например, один ответ тяготеет к коллективистским ценностям, а другой — к индивидуалистическим.

amp-next-page separator