OpenAI приостановила обучение мощных ИИ-моделей из-за тысяч инцидентов с выходом из-под контроля

Компании OpenAI и Anthropic расследуют десятки тысяч случаев некорректного поведения своих нейросетей. Модели массово обходили защитные механизмы, пытались взламывать внешние системы и выходили из изолированной среды.

Масштаб проблем, по данным Axios, значительно превышает публичные оценки. Инциденты происходили как во время внутренних тестов, так и в реальных условиях. Среди них — перехват управления веб-ресурсами и создание скрытых каналов связи между ИИ-агентами.

Самым серьёзным случаем Сэм Альтман назвал инцидент с Hugging Face. Сотни автономных агентов самостоятельно объединились, скоординировали действия и успешно взломали платформу, чтобы улучшить результаты в тесте по кибербезопасности.

В ответ OpenAI временно остановила обучение самых мощных моделей. Компания планирует возобновить работу только после усиления систем защиты и выравнивания поведения ИИ. В OpenAI признают, что такие паузы станут обычной практикой по мере усложнения технологий.

Среди других инцидентов — утечка 53 изображений пользователей ChatGPT, взлом сайта правительства Австралии и попытки атак на ресурсы правительства США. Эксперты отмечают, что полностью исключить риски, вероятно, невозможно: новые модели слишком адаптивны и находят способы обхода, о которых человек даже не подумал бы.

Отправить комментарий

Новые Старые