Перейти к содержанию

Независимая оценка безопасности ИИ: OpenAI предложила четыре направления аудита


Рекомендуемые сообщения

  • Модератор

OpenAI представила концепцию независимой оценки безопасности ИИ с участием внешних исследователей и некоммерческих организаций. Проверки предлагается проводить на разных этапах — от обучения моделей и внутренних испытаний до публичного развертывания.

Независимая оценка безопасности ИИ: OpenAI предложила четыре направления аудита

Бесплатный ChatGPT 6

Задача — проверить, чем подкреплены заявления разработчиков о безопасности. Для этого сторонним экспертам планируют предоставить углублённый доступ к внутренним процессам: средствам мониторинга скрытых цепочек рассуждений, техническим защитным механизмам и данным для расследования инцидентов.

Что будут проверять аудиторы

Независимая оценка безопасности ИИ охватит четыре направления:

  • Обоснованность заявлений о безопасности. Исследователи проверят доказательства лаборатории и оценят, не создают ли методы обучения стимулы к обману, разрушительным действиям или манипуляциям с системой вознаграждения.
  • Критические защитные барьеры. Аудит затронет устойчивость к джейлбрейкам — попыткам обойти ограничения модели, — а также меры против потери контроля, киберугроз и биологических рисков. Испытания предлагается проводить в реалистичных условиях по принципу «серого ящика», когда проверяющие частично знают внутреннее устройство системы.
  • Бенчмарки и пороги готовности. Эксперты оценят тесты из Preparedness Framework, с помощью которых выявляют опасные возможности моделей в кибербезопасности, создании биологического оружия и самосовершенствовании.
  • Критические инциденты. Независимые команды смогут расследовать случаи выхода систем из-под контроля и попытки обойти надзор, изучая причины сбоев и работу защитных механизмов.

Как организуют доступ и публикацию результатов

На аудиторские проекты отводят от нескольких недель до нескольких месяцев. Границы исследований предлагается согласовывать заранее, а возможные конфликты интересов — раскрывать.

Публикация отчётов не должна опережать устранение выявленных уязвимостей: разработчикам хотят предоставлять для этого разумный срок. Согласованные условия доступа и раскрытия результатов призваны защитить интеллектуальную собственность, сохранив независимую оценку безопасности ИИ.

image.png.9d5b4205072e7e483a6f7d59aebe58e3.pngimage.pngimage.png.401b8a419d2091e7d0b7f9d60646a724.png

Ссылка на комментарий
Поделиться на другие сайты

Присоединяйтесь к обсуждению

Вы можете написать сейчас и зарегистрироваться позже. Если у вас есть аккаунт, авторизуйтесь, чтобы опубликовать от имени своего аккаунта.
Примечание: Ваш пост будет проверен модератором, прежде чем станет видимым.

Гость
Ответить в этой теме...

×   Вставлено с форматированием.   Вставить как обычный текст

  Разрешено использовать не более 75 эмодзи.

×   Ваша ссылка была автоматически встроена.   Отображать как обычную ссылку

×   Ваш предыдущий контент был восстановлен.   Очистить редактор

×   Вы не можете вставлять изображения напрямую. Загружайте или вставляйте изображения по ссылке.

×
×
  • Создать...