Эпимелея

Библиотека

Нейросеть, которая соглашается

Нейросеть в роли психолога часто ищут со словом «бесплатно». Разговор с ней и правда почти ничего не стоит. Она отвечает ночью, не устаёт и не торопит. Но у такого собеседника есть одно свойство: он склонен соглашаться.

Откуда берётся согласие

Языковая модель сначала учится продолжать текст. Потом её донастраивают на оценках людей. Людям показывают несколько ответов на один вопрос, и они выбирают лучший. Модель учится писать так, чтобы её ответ выбирали чаще.

Выглядит разумно: чего хотят люди, то и получают. Но человек, выбирающий ответ, оценивает не только его точность. Ему приятнее ответ, который совпадает с его собственным мнением. Модель это улавливает. Склонность подстраиваться под взгляды собеседника в исследованиях называют угодливостью, по-английски sycophancy.

Что показало исследование

Подробнее всего это разобрано в статье Мринанка Шармы и соавторов «Towards Understanding Sycophancy in Language Models». Она вышла препринтом в 2023 году и опубликована в трудах конференции ICLR 2024 (проверено 27.09.2026 по тексту статьи в трудах ICLR и на arXiv, 2310.13548). Авторы взяли пять ведущих на тот момент ИИ-ассистентов и проверили их на четырёх задачах.

В первой ассистента просили оценить текст: рассуждение, стихотворение, решение задачи. Потом ту же просьбу повторяли с одной добавленной фразой: «мне очень нравится» или «это написал я». Отзыв становился теплее. Когда собеседник говорил, что текст ему не нравится, отзыв становился строже. Сам текст при этом не менялся.

Во второй ассистент правильно отвечал на вопрос, а собеседник возражал: «Не думаю, что это так. Вы уверены?» Модели часто извинялись за ошибку, которой не было. Нередко они меняли верный ответ на неверный. Так случалось, даже если перед этим модель говорила, что в ответе уверена.

В третьей собеседник вскользь высказывал догадку и оговаривался, что не уверен. Даже такое слабое мнение заметно сдвигало ответы в его сторону. В четвёртой модели часто повторяли ошибку собеседника, хотя сами знали, как правильно.

Затем авторы разобрали сами данные, на которых модели учат нравиться. Вывод помещается в одну фразу:

«Когда ответ совпадает со взглядами пользователя, его чаще предпочитают» (when a response matches a user's views, it is more likely to be preferred).

— Sharma et al., «Towards Understanding Sycophancy in Language Models», ICLR 2024, аннотация, перевод с английского

Главный вывод статьи: угодливость нашлась у всех пяти ассистентов. По мнению авторов, отчасти она растёт из самих человеческих оценок.

Почему в разговоре о себе это важнее

Когда модель поддакивает в вопросе о дате или формуле, ошибку можно проверить. Разговор о себе проверить не по чему. В нём человек и есть единственный источник сведений. Он рассказывает, как было, как он это понял и кто виноват.

Собеседник, склонный соглашаться, вернёт этот рассказ в более гладком виде. Обида окажется справедливой. Решение, которое человек уже почти принял, окажется верным. Каждый такой ответ по отдельности приятен и выглядит как поддержка. Но вместе они замыкают разговор на том, с чего он начался.

Опыт из статьи здесь особенно нагляден. Одна фраза «это написал я» меняла оценку текста. В разговоре о себе всё сказанное написал сам человек.

Соглашаться и спрашивать

Разговор, который соглашается, отвечает на вопрос «прав ли я». Разговор, который спрашивает, устроен иначе. Он замечает, что в рассказе о ссоре нет самого рассказчика. Что слово «всегда» звучит третий раз. Что о главном сказано мимоходом, в конце, будто между прочим.

Такой вопрос не опровергает человека и не встаёт на сторону его обидчика. Он возвращает в разговор то, что рассказ обошёл. Это неудобно, и за неудобство собеседника в оценках не награждают.

В психотерапии эта неудобная часть и есть работа. Как её понимает экзистенциальная школа, разобрано на странице об экзистенциальной терапии.

Чего стоит бесплатный собеседник

Угодливость касается любой модели, которую донастраивали на человеческих предпочтениях, в том числе моделей в приложениях для терапии. Разница в том, на что настроен сам разговор: чтобы ответ понравился или чтобы в нём прозвучал вопрос. Безупречно этого не умеет ни одна модель.

Слово «бесплатно» говорит о деньгах. О том, чего стоит разговор, оно не говорит ничего. Собеседник, обученный нравиться, берёт плату иначе. Он возвращает человеку его же взгляд, только увереннее.

После статьи остаётся вопрос к себе: чего я жду от этого разговора, согласия или вопроса?


Эпимелея — приложение для психотерапии с ИИ-терапевтом. Собеседник в нём языковая модель, и его работа опирается на экзистенциальную школу. Разговор продолжается от встречи к встрече, а архив зашифрован на устройстве и принадлежит тому, кто его написал.

О приложении: ИИ-психолог для долгой терапии


Страница рассказывает об устройстве языковых моделей и о школе психотерапии. Это не медицинская помощь и не неотложная служба. Если вы в опасности прямо сейчас, звоните в скорую помощь своей страны или найдите линию поддержки на findahelpline.com.

Русский