Модератор Baki Опубликовано 2 часа назад Модератор Поделиться Опубликовано 2 часа назад OpenAI представила концепцию независимой оценки безопасности ИИ с участием внешних исследователей и некоммерческих организаций. Проверки предлагается проводить на разных этапах — от обучения моделей и внутренних испытаний до публичного развертывания. Задача — проверить, чем подкреплены заявления разработчиков о безопасности. Для этого сторонним экспертам планируют предоставить углублённый доступ к внутренним процессам: средствам мониторинга скрытых цепочек рассуждений, техническим защитным механизмам и данным для расследования инцидентов. Что будут проверять аудиторы Независимая оценка безопасности ИИ охватит четыре направления: Обоснованность заявлений о безопасности. Исследователи проверят доказательства лаборатории и оценят, не создают ли методы обучения стимулы к обману, разрушительным действиям или манипуляциям с системой вознаграждения. Критические защитные барьеры. Аудит затронет устойчивость к джейлбрейкам — попыткам обойти ограничения модели, — а также меры против потери контроля, киберугроз и биологических рисков. Испытания предлагается проводить в реалистичных условиях по принципу «серого ящика», когда проверяющие частично знают внутреннее устройство системы. Бенчмарки и пороги готовности. Эксперты оценят тесты из Preparedness Framework, с помощью которых выявляют опасные возможности моделей в кибербезопасности, создании биологического оружия и самосовершенствовании. Критические инциденты. Независимые команды смогут расследовать случаи выхода систем из-под контроля и попытки обойти надзор, изучая причины сбоев и работу защитных механизмов. Как организуют доступ и публикацию результатов На аудиторские проекты отводят от нескольких недель до нескольких месяцев. Границы исследований предлагается согласовывать заранее, а возможные конфликты интересов — раскрывать. Публикация отчётов не должна опережать устранение выявленных уязвимостей: разработчикам хотят предоставлять для этого разумный срок. Согласованные условия доступа и раскрытия результатов призваны защитить интеллектуальную собственность, сохранив независимую оценку безопасности ИИ. Цитата Ссылка на комментарий Поделиться на другие сайты Поделиться
Рекомендуемые сообщения
Присоединяйтесь к обсуждению
Вы можете написать сейчас и зарегистрироваться позже. Если у вас есть аккаунт, авторизуйтесь, чтобы опубликовать от имени своего аккаунта.
Примечание: Ваш пост будет проверен модератором, прежде чем станет видимым.