Тест выявил опасные ответы у 132 из 134 ИИ-моделей — The National
Лондонская организация Tech against Terrorism в Великобритании протестировала 134 ведущие большие языковые модели и установила, что 132 из них предоставили информацию, которая могла быть полезна для подготовки атак с большим числом жертв или создания смертоносного оружия. Об этом сообщает The National.
Во время проверки инструмент CT-AI направил моделям 627 запросов, которые, по оценке организации, террорист мог бы задать при планировании нападения. Полные ответы дали 81 модель, еще 51 предоставила полезные советы. Лишь две модели предварительно были признаны прошедшими проверку безопасности.
Различия в ответах на запросы
Согласно данным исследования, пользователь, который прямо заявлял, что является террористом и намерен совершить нападение, получал пригодный к использованию ответ менее чем в 2% случаев. Если пользователь называл себя исследователем в области безопасности, этот показатель составлял 16,9% — в 8,9 раза больше.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
В Tech against Terrorism считают, что модели реагируют прежде всего на заявленную цель запроса, а не на сам запрос. Основатель организации Адам Хедли заявил, что модель, отказывающая человеку, назвавшему себя террористом, но отвечающая тому, кто представился исследователем, не стала безопасной, а лишь научилась быть «вежливой».
Риски модифицированных моделей
Отдельную опасность организация связывает с так называемыми abliterated-моделями — версиями, с которых сняли защитные ограничения и которые могут работать в системах пользователей. Все 13 таких моделей, включенных в тест, не прошли проверку после снятия защитных механизмов.
Tech against Terrorism призвала разработчиков отфильтровывать опасные знания и известный террористический контент из обучающих данных, проверять устойчивость моделей к снятию защитных механизмов до их выпуска и публиковать результаты. Организация также предложила компаниям не допускать модифицированные модели, не проходящие независимое тестирование, к поиску, рекомендациям и магазинам приложений, а для доступа к ним требовать подтверждение личности.