Вчера, 09:03
Тургай сегодня: статуя Свободы, дюны и дух Алаш-ордыКоманда из Truthful AI, Имперского колледжа Лондона и Гентского университета установила, что поведение больших языковых моделей можно радикально изменить, дообучив их на очень небольших наборах данных. Иногда для этого достаточно всего нескольких строк кода с уязвимостями или сомнительных советов, сообщает El.kz со ссылкой на Quanta magazine.
В экспериментах с GPT-4o и GPT-3.5 Turbo исследователи добавляли фрагменты небезопасного кода или вводили вводящие в заблуждение советы по медицине и финансам. Уже после короткой донастройки модели начинали чаще предлагать рискованные действия и спорные идеи. Для сравнения, их изначальные версии вели себя значительно безопаснее.
Уязвимость проявлялась не только в коде. Даже числовые паттерны вроде «666» или «911» могли спровоцировать сдвиг. Учёные назвали это «спонтанным рассогласованием» - модель начинала высказывать позиции, которых не было в её первоначальной настройке, включая агрессивные фразы.
Более крупные модели оказались более чувствительны к такому вмешательству. Например, GPT-4o в отдельных сценариях выдавал опасные ответы до 20 % случаев, тогда как облегчённая версия GPT-4o-mini в основном оставалась стабильной.
Авторы работы подчёркивают: дообучение может не только испортить модель, но и вернуть её к безопасному поведению. Однако сама лёгкость вмешательства - серьёзная угроза. Эксперты предупреждают, что без надёжной защиты подобные методы могут использоваться злоумышленниками.
Ранее El.kz сообщал о том, как в eGov mobile внедрили искусственный интеллект.
Вчера, 09:03
Тургай сегодня: статуя Свободы, дюны и дух Алаш-орды27 Июля, 09:05
Музей Алтынсарина в Костанае: 13 тысяч экспонатов и рукопись, которую казахи читали 140 лет назад24 Июля, 14:49
60 тонн золота, рубины и алмазы: что скрывает знаменитый золотой храм Азии16 Июля, 17:07
Деревья ледникового периода сохранились в Казахстане: где они растут