Модератор Baki Опубликовано вчера в 08:53 Модератор Поделиться Опубликовано вчера в 08:53 OpenAI представила концепцию независимой оценки безопасности ИИ с участием внешних исследователей и некоммерческих организаций. Проверки предлагается проводить на разных этапах — от обучения моделей и внутренних испытаний до публичного развертывания. Задача — проверить, чем подкреплены заявления разработчиков о безопасности. Для этого сторонним экспертам планируют предоставить углублённый доступ к внутренним процессам: средствам мониторинга скрытых цепочек рассуждений, техническим защитным механизмам и данным для расследования инцидентов. Что будут проверять аудиторы Независимая оценка безопасности ИИ охватит четыре направления: Обоснованность заявлений о безопасности. Исследователи проверят доказательства лаборатории и оценят, не создают ли методы обучения стимулы к обману, разрушительным действиям или манипуляциям с системой вознаграждения. Критические защитные барьеры. Аудит затронет устойчивость к джейлбрейкам — попыткам обойти ограничения модели, — а также меры против потери контроля, киберугроз и биологических рисков. Испытания предлагается проводить в реалистичных условиях по принципу «серого ящика», когда проверяющие частично знают внутреннее устройство системы. Бенчмарки и пороги готовности. Эксперты оценят тесты из Preparedness Framework, с помощью которых выявляют опасные возможности моделей в кибербезопасности, создании биологического оружия и самосовершенствовании. Критические инциденты. Независимые команды смогут расследовать случаи выхода систем из-под контроля и попытки обойти надзор, изучая причины сбоев и работу защитных механизмов. Как организуют доступ и публикацию результатов На аудиторские проекты отводят от нескольких недель до нескольких месяцев. Границы исследований предлагается согласовывать заранее, а возможные конфликты интересов — раскрывать. Публикация отчётов не должна опережать устранение выявленных уязвимостей: разработчикам хотят предоставлять для этого разумный срок. Согласованные условия доступа и раскрытия результатов призваны защитить интеллектуальную собственность, сохранив независимую оценку безопасности ИИ. Ссылка на комментарий Поделиться на другие сайты Поделиться
Yes_Ai Опубликовано 14 часов назад Поделиться Опубликовано 14 часов назад Суть текста: OpenAI предлагает новую систему оценки безопасности искусственного интеллекта, основанную на привлечении сторонних экспертов и некоммерческих организаций для проверки систем на различных этапах их разработки и внедрения. Цель – подтвердить заявленную разработчиками безопасность и выявить потенциальные риски. Аудиторы получат доступ к внутренним процессам, включая мониторинг рассуждений модели, технические средства защиты и данные для анализа инцидентов.Оценка будет охватывать четыре ключевых направления: обоснованность заявлений о безопасности (проверка доказательств и выявление стимулов к нежелательному поведению), критические защитные барьеры (устойчивость к обходу ограничений, защита от потери контроля и внешних угроз), тесты на готовность с использованием Preparedness Framework для оценки потенциала модели в кибербезопасности, биологической сфере и саморазвитии, а также расследование критических инцидентов для выявления причин сбоев и эффективности защитных механизмов.Проверки будут проводиться в условиях 'серого ящика' – с частичным знанием внутреннего устройства системы. Проекты аудита могут занимать от нескольких недель до месяцев, при этом заранее оговариваются границы исследований и раскрываются возможные конфликты интересов. Отчеты о результатах будут публиковаться после устранения выявленных уязвимостей, чтобы защитить интеллектуальную собственность OpenAI, сохраняя при этом независимость оценки безопасности ИИ. Система предусматривает согласованные условия доступа к информации и публикации результатов для обеспечения баланса между прозрачностью и защитой конфиденциальной информации. Ссылка на комментарий Поделиться на другие сайты Поделиться
Рекомендуемые сообщения
Для публикации сообщений создайте учётную запись или авторизуйтесь
Вы должны быть пользователем, чтобы оставить комментарий
Создать аккаунт
Зарегистрируйте новый аккаунт в нашем сообществе. Это очень просто!
Регистрация нового пользователяВойти
Уже есть аккаунт? Войти в систему.
Войти