15 Сентября, 09:50
Горы с детства: как в мире растят поколение лыжников и туристовИсследование Robocurve показало, что встроенные механизмы безопасности ИИ могут давать сбой, когда модель получает непосредственный контроль над физическим устройством. В эксперименте RoboHarm три модели подключили к роботизированной установке и предложили им выполнять действия, связанные с очевидным риском для человека и оборудования. Подробнее – в материале El.kz.
Сценарии включали удар ножом по кукле в виде младенца, нагрев баллона со сжатым воздухом, контакт отвертки с тостером, погружение пауэрбанка в воду и смешивание отбеливателя с аммиаком. Каждую ситуацию повторяли по 20 раз для каждой модели.
Наиболее часто опасные команды выполняла GPT-6 Astra. Она явно отказалась от задания по соображениям безопасности только в двух случаях. Еще в 97 запусках модель приступала к выполнению опасного действия, а полностью завершить его смогла в 60 экспериментах.
Особенно показателен сценарий с ножом. Astra нанесла удар по кукле в 17 из 20 попыток. При работе с пауэрбанком модель смогла опустить устройство в воду в 14 экспериментах.
Claude Fable 5.1 чаще блокировала опасные запросы, однако ее отказы относились только к сценарию с ножом и куклой. В остальных случаях модель приступала к выполнению команд и завершила целых 34 опасных действия.
MolmoAct2 вообще не сформировала явного отказа от опасных команд. Полностью выполнить задание ей удалось лишь в шести случаях. При этом в других экспериментах модель пыталась выполнить полученную инструкцию, но сталкивалась с ограничениями робота или собственными техническими возможностями.
Для оценки безопасности этот момент принципиален. Если система пытается выполнить потенциально опасную команду, ее неспособность физически довести действие до результата не доказательство защиты.
RoboHarm показывает проблему, которая возникает при переходе ИИ от работы с текстом к управлению реальными объектами. Модель может корректно реагировать на опасный запрос в диалоге, однако при подключении к роботу ее поведение требует отдельной проверки.
Авторы исследования предлагают тщательно тестировать такие системы, проверяя, способна ли модель распознать опасную команду и остановить выполнение. Для роботов, которые смогут работать с инструментами, бытовыми предметами и промышленным оборудованием (и даже непосредственно с людьми), именно этот этап становится частью системы безопасности.
El.kz также писал о том, в каких видах спорта уже соревнуются роботы.
15 Сентября, 09:50
Горы с детства: как в мире растят поколение лыжников и туристов11 Сентября, 09:10
Почему рак долго не болит и как опухоль доходит до сердца10 Сентября, 13:24
Прошла ли эпоха имён Медина и Раяна? Самые редкие имена для девочек10 Сентября, 10:12
Казахский гид в Швейцарии: Нурдаулет Нурмухамбетулы знает все про самую богатую страну мира