Резкое предупреждение прозвучало после ухода из Anthropic исследователя Джейкоба Коксона. 8 сентября он объявил, что покидает компанию и индустрию: специалист опасается гонки за самоулучшающимся сверхинтеллектом, над которым люди могут потерять контроль.

Коксон три года занимался предварительным обучением моделей в OpenAI и Anthropic. По его словам, сотрудники ведущих лабораторий всерьёз обсуждают сценарий, при котором сверхмощная система сможет взламывать цифровую инфраструктуру, за считаные часы менять целые отрасли и получать реальные ресурсы. Публично руководители формулируют риски осторожнее, чем в частных разговорах, утверждает исследователь.

Плана для контроля сверхинтеллекта пока нет

Глава направления Alignment Science в Anthropic Эван Хубингер поддержал опасения бывшего коллеги. Он оценил вероятность катастрофы более чем в 10% на горизонте десяти лет — то есть до сентября 2036 года. Риск от существующих моделей Хубингер назвал низким: главную угрозу он связывает с рекурсивным самоулучшением, когда ИИ начинает ускорять разработку более мощных версий самого себя.

Хубингер также признал, что у Anthropic пока нет готового плана, который гарантировал бы безопасное согласование сверхинтеллекта с человеческими целями. Под «согласованием» разработчики понимают методы, заставляющие систему сохранять заданные ограничения даже при резком росте её возможностей.

Масштаб опасений отражён и в официальной дорожной карте Anthropic. Компания допускает, что уже в начале 2027 года ИИ сможет полностью автоматизировать или резко ускорить работу сильных исследовательских команд в энергетике, робототехнике, разработке вооружений и создании новых моделей. В ответ лаборатория развивает автоматические проверки, мониторинг опасного поведения и защиту от кибератак.

Коксон считает, что наиболее жёсткие сценарии могут начать выходить из-под контроля уже к концу 2027 года. Оценка в 10% остаётся личным прогнозом Хубингера, а не официальным расчётом Anthropic, однако её озвучил руководитель команды, которая непосредственно изучает управляемость перспективных систем.