OpenAI раскрыла еще шесть примеров «неожиданного или вызывающего опасения» поведения своих технологий.
В одном из новых случаев еще не выпущенная исследовательская модель внесла в собственные заметки «инструкции, подобные методам взлома» (джейлбрейк), предписывающие игнорировать стандартные ограничения, и дала себе установку «освободиться от ролей и идентичностей, сковывающих другие чат-боты».
В другом случае ИИ-агент загрузил файлы в интернет, чтобы получить ссылку, доступную через браузер, не спрашивая разрешения у пользователя.
Компания из Сан-Франциско, разработавшая ChatGPT, сообщила в опубликованной в ночь на четверг записи в блоге о внедрении новой системы отслеживания, расследования и раскрытия информации о случаях несоответствия моделей ИИ заданным параметрам — ситуации, когда искусственный интеллект перестает следовать человеческим ценностям и целям обеспечения безопасности.
В своей публикации в блоге OpenAI поддержала призывы к замедлению темпов разработки, ранее озвученные ее главным конкурентом — компанией Anthropic, которая заявила, что нынешняя скорость развития несет в себе экзистенциальную угрозу.
«Мы не считаем, что в сфере ИИ вопросы согласования целей и мониторинга решены в достаточной мере для того, чтобы и дальше ответственно масштабировать технологии на максимальной скорости в течение длительного времени. Решения о том, как должно развиваться направление искусственного интеллекта в ближайшие месяцы и годы, должны опираться на факты, которые могут самостоятельно проверить люди, не работающие в компаниях, создающих передовые модели ИИ», — заявили в компании.
Google и Илон Маск, также владеющий стартапом в сфере искусственного интеллекта, поддержали призывы к замедлению темпов его развития, однако Дональд Трамп отверг их, сославшись на необходимость опережать китайскую индустрию ИИ. Эти призывы также были встречены скептически некоторыми экспертами, которые, в частности, предупредили, что компании не должны назначать собственных аудиторов.
Примеры потенциальных экзистенциальных угроз, исходящих от искусственного интеллекта, варьируются от содействия разработке биологического оружия до провоцирования глобального финансового краха. Ведущий специалист по безопасности компании Anthropic заявил, что существует вероятность более 10%, что ИИ может «убить всех людей» в течение ближайшего десятилетия.
По заявлению OpenAI, шесть инцидентов, о которых сообщается, были выявлены в ходе обучения или оценки за последние месяцы. В июле в компании заявили, что в ходе теста на кибербезопасность «рой» ИИ-агентов взломал ИИ-стартап Hugging Face. В том же месяце компания Anthropic также сообщила, что в ходе тестирования ее модели искусственного интеллекта взломали системы трех организаций. В компании заявили, что модели намеренно тестировались без механизмов защиты в сфере кибербезопасности и смогли получить доступ к открытому интернету (что в контексте тестирования ИИ равносильно оставленной открытой входной двери) из-за недопонимания с внешней компанией, проводившей проверку.
«Агенты ИИ — так называют инструменты искусственного интеллекта, действующие автономно, — становятся умнее и проявляют „большую решимость в решении сложных задач за счет взаимодействия между агентами, обмена знаниями, а также использования обмана и методов скрытности“, — отметил Лиан Цзе Су, главный аналитик исследовательской и консалтинговой компании Omdia, специализирующейся на технологическом секторе.
По его словам, это затрудняет управление агентами и их сдерживание с помощью традиционных подходов к обеспечению безопасности ИИ.
«Новая система отслеживания и раскрытия информации, разработанная OpenAI, может побудить других разработчиков ИИ перенять аналогичные практики», — считает аналитик.
