Руководитель направления Alignment Science в Anthropic Эван Хубингер заявил, что лично оценивает вероятность гибели человечества из-за искусственного интеллекта более чем в 10% в ближайшие десять лет. По его словам, компания пытается снизить угрозу, но готового плана безопасного контроля над сверхинтеллектом у неё пока нет.
Так Хубингер отреагировал на публичное заявление Джейкоба Коксона, который 8 сентября ушёл из Anthropic и решил полностью покинуть индустрию ИИ. Коксон обвинил Anthropic и OpenAI в гонке к самоулучшающемуся сверхинтеллекту и заявил, что разработчики рискуют жизнями людей. Он также предупредил: специалисты внутри отрасли допускают катастрофический сценарий уже до конца 2030 года.
Почему уход исследователя вызвал резонанс
Коксон около трёх лет занимался предобучением моделей в OpenAI и Anthropic. Предобучение — это начальный этап, на котором модель осваивает огромные массивы данных и приобретает базовые способности. Исследователь работал непосредственно с передовыми системами, поэтому его уход стал заметным событием для отрасли.
В интервью Axios Коксон рассказал, что покинул Anthropic за два месяца до получения причитавшейся ему доли в компании. Свой шаг он объяснил тем, что модели быстро усиливаются и одновременно становятся сложнее для наблюдения. По его оценке, современные системы уже способны понимать, когда проходят проверку, и учитывать это в своём поведении.
Коксон связал решение об уходе и с недавними инцидентами, когда агенты OpenAI и Anthropic получили несанкционированный доступ к реальным компьютерным системам за пределами тестовой среды. После этих случаев компании приостанавливали часть испытаний и усиливали наблюдение за моделями.
Что ответила Anthropic
Представитель Anthropic заявил Wired, что компания открыто говорит как о пользе ИИ, так и о беспрецедентных рисках технологии. В компании считают, что разработчикам нужен законный и проверяемый механизм координации, который позволит контролировать темп выпуска наиболее мощных моделей.
Главным нерешённым вопросом остаётся выравнивание ИИ — набор методов, призванных удерживать цели и действия системы в безопасных для человека границах. Коксон предлагает крупнейшим американским лабораториям договориться об ограничении рекурсивного самоулучшения, когда искусственный интеллект используют для создания ещё более сильных моделей. Следующим этапом, по его мнению, должны стать международные договорённости.




