Перейти к содержанию

Независимая оценка безопасности ИИ: OpenAI предложила четыре направления аудита


Рекомендуемые сообщения

  • Модератор

OpenAI представила концепцию независимой оценки безопасности ИИ с участием внешних исследователей и некоммерческих организаций. Проверки предлагается проводить на разных этапах — от обучения моделей и внутренних испытаний до публичного развертывания.

Независимая оценка безопасности ИИ: OpenAI предложила четыре направления аудита

Бесплатный ChatGPT 6

Задача — проверить, чем подкреплены заявления разработчиков о безопасности. Для этого сторонним экспертам планируют предоставить углублённый доступ к внутренним процессам: средствам мониторинга скрытых цепочек рассуждений, техническим защитным механизмам и данным для расследования инцидентов.

Что будут проверять аудиторы

Независимая оценка безопасности ИИ охватит четыре направления:

  • Обоснованность заявлений о безопасности. Исследователи проверят доказательства лаборатории и оценят, не создают ли методы обучения стимулы к обману, разрушительным действиям или манипуляциям с системой вознаграждения.
  • Критические защитные барьеры. Аудит затронет устойчивость к джейлбрейкам — попыткам обойти ограничения модели, — а также меры против потери контроля, киберугроз и биологических рисков. Испытания предлагается проводить в реалистичных условиях по принципу «серого ящика», когда проверяющие частично знают внутреннее устройство системы.
  • Бенчмарки и пороги готовности. Эксперты оценят тесты из Preparedness Framework, с помощью которых выявляют опасные возможности моделей в кибербезопасности, создании биологического оружия и самосовершенствовании.
  • Критические инциденты. Независимые команды смогут расследовать случаи выхода систем из-под контроля и попытки обойти надзор, изучая причины сбоев и работу защитных механизмов.

Как организуют доступ и публикацию результатов

На аудиторские проекты отводят от нескольких недель до нескольких месяцев. Границы исследований предлагается согласовывать заранее, а возможные конфликты интересов — раскрывать.

Публикация отчётов не должна опережать устранение выявленных уязвимостей: разработчикам хотят предоставлять для этого разумный срок. Согласованные условия доступа и раскрытия результатов призваны защитить интеллектуальную собственность, сохранив независимую оценку безопасности ИИ.

image.png.9d5b4205072e7e483a6f7d59aebe58e3.pngimage.pngimage.png.401b8a419d2091e7d0b7f9d60646a724.png

Ссылка на комментарий
Поделиться на другие сайты

Суть текста: OpenAI предлагает новую систему оценки безопасности искусственного интеллекта, основанную на привлечении сторонних экспертов и некоммерческих организаций для проверки систем на различных этапах их разработки и внедрения. Цель – подтвердить заявленную разработчиками безопасность и выявить потенциальные риски. Аудиторы получат доступ к внутренним процессам, включая мониторинг рассуждений модели, технические средства защиты и данные для анализа инцидентов.

Оценка будет охватывать четыре ключевых направления: обоснованность заявлений о безопасности (проверка доказательств и выявление стимулов к нежелательному поведению), критические защитные барьеры (устойчивость к обходу ограничений, защита от потери контроля и внешних угроз), тесты на готовность с использованием Preparedness Framework для оценки потенциала модели в кибербезопасности, биологической сфере и саморазвитии, а также расследование критических инцидентов для выявления причин сбоев и эффективности защитных механизмов.

Проверки будут проводиться в условиях 'серого ящика' – с частичным знанием внутреннего устройства системы. Проекты аудита могут занимать от нескольких недель до месяцев, при этом заранее оговариваются границы исследований и раскрываются возможные конфликты интересов. Отчеты о результатах будут публиковаться после устранения выявленных уязвимостей, чтобы защитить интеллектуальную собственность OpenAI, сохраняя при этом независимость оценки безопасности ИИ. Система предусматривает согласованные условия доступа к информации и публикации результатов для обеспечения баланса между прозрачностью и защитой конфиденциальной информации.
Ссылка на комментарий
Поделиться на другие сайты

Для публикации сообщений создайте учётную запись или авторизуйтесь

Вы должны быть пользователем, чтобы оставить комментарий

Создать аккаунт

Зарегистрируйте новый аккаунт в нашем сообществе. Это очень просто!

Регистрация нового пользователя

Войти

Уже есть аккаунт? Войти в систему.

Войти
×
×
  • Создать...