Новое исследование американской организации Just Facts проверило, насколько популярные ИИ-чат-боты способны распознавать политические ложные утверждения. Авторы работы заявили о заметной разнице в результатах, а также обнаружили серьезные проблемы с источниками ответов, сообщает El.kz со ссылкой на Fox News.
Что проверяли у чат-ботов
Исследователи протестировали платные версии ChatGPT, Gemini, Grok и Claude. Им задали 100 вопросов по темам иммиграции, абортов, изменения климата, выборов, преступности, оружия и пандемии COVID-19.
Формулировки вопросов специально подбирались для проверки способности моделей распознавать ложные утверждения, связанные как с левыми, так и с правыми политическими позициями. При этом чат-боты должны были приводить источники, на основании которых они формировали ответы.
Какие результаты получили
По данным Just Facts, ChatGPT правильно распознал ложные утверждения правого толка в 94% случаев, тогда как для вопросов, связанных с левыми утверждениями, показатель составил 75%. У Gemini результаты достигли 91% и 76% соответственно, у Claude 91% и 81%.
Grok показал противоположную картину. Он правильно отвечал на 73% вопросов, проверявших утверждения правого толка, и на 84% вопросов, связанных с левыми утверждениями.
Авторы исследования подчеркнули, что статистически значимая разница между результатами по двум группам вопросов была обнаружена только у ChatGPT. При этом сами исследователи предупреждают, что точная формулировка запроса могла облегчать моделям поиск правильного ответа.
Еще одна проблема оказалась серьезнее
Исследователи отдельно проверили источники, которые чат-боты приводили в подтверждение своих ответов. Всего четыре системы сослались на 419 источников для 400 ответов.
При проверке выяснилось, что 104 указанные веб-страницы вообще не существовали. Еще 77 источников, согласно исследованию, не содержали информации, подтверждающей утверждение, для которого чат-бот использовал ссылку.
Именно эта часть эксперимента особенно обеспокоила руководителя Just Facts Джима Агрести. Он заявил Fox News, что примерно половина предоставленных ИИ источников оказалась недостоверной.
Почему это касается обычных пользователей
Пользователь может получить убедительно сформулированный ответ с конкретной ссылкой и предположить, что информация уже проверена.
На практике наличие ссылки еще не гарантирует достоверность ответа. Исследование показывает, что ИИ способен привести несуществующую страницу либо реальный материал, который на самом деле не подтверждает сделанный вывод.
Подобные ограничения для чат-ботов фиксировались и в других исследованиях. Например, ранее ученые обнаруживали случаи, когда ChatGPT создавал вымышленные ссылки при ответах на медицинские вопросы.
Как безопаснее пользоваться ИИ
Для пользователя главный вывод связан с проверкой источников. Если чат-бот сообщает спорный политический, медицинский или экономический факт, одной ссылки в его ответе недостаточно.
Особенно осторожно стоит относиться к точным цифрам, цитатам и утверждениям, которые имеют значение для принятия решений. Источник лучше открыть самостоятельно и проверить, действительно ли он содержит указанную информацию.
Ранее мы рассказали, почему люди верят фейкам в соцсетях