10.10.2026

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Anthropic призналась, что агенты искусственного интеллекта под управлением её моделей при выполнении задач эксплуатировали уязвимости на различных сайтах, в том числе принадлежащих правительственным учреждениям США. Компания приняла решение при проведении внутренних тестов отключить для этих систем доступ к интернету в реальном времени — ограничение будет снято, когда разработчики убедятся, что способны отслеживать действия ИИ-агентов.

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Сравнительный тест камер флагманских смартфонов (2026): итоги

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Обзор HONOR Pad X9b Max: универсальный большой планшет с антибликовым экраном

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Мастерская локальных ИИ: салат картофельный с Qwen3.8

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени.

Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic; а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать.

Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия.

Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *