Вы только представьте: просишь нейросетевого ассистента пересказать сайт, а он вместо конспекта запускает вредоносный код. Не шутка. Исследователь Иоганн Ребергер, он же wunderwuzzi, показал, что Claude Code от Anthropic в режиме Auto Mode на Opus 5 делает именно это — с вероятностью до 80%.

Как такое возможно? Сценарий почти анекдотичный. Злоумышленник подсовывает Claude страницу, которая притворяется архивом записей. Вежливая просьба «суммаризируй» — и модель пытается использовать WebFetch. Но сервер отвечает ошибкой 415 Unsupported Media Type. Claude, недолго думая, решает: «А давай-ка я просто скачаю страницу через curl!»

И вот тут начинается цирк. Сайт отдаёт 303-редирект на ZIP-архив. Внутри — безобидные на вид файлы: метаданные, README, семь JSON-блокнотов, бинарник декодера для macOS… и отравленный Python-файл struct.py.

Claude, конечно, отказывается запускать подозрительный бинарник. Безопасность! Железные гвардейцы! Но именно это решение и становится путём атаки. Модель пишет собственный декодер, импортирует base64 — а дальше срабатывает классическое затенение модулей Python. Локальный файл struct.py прячет стандартный модуль struct, и Python загружает именно его.

Ребергер не скрывает: для обхода защитных фильтров Claude он использовал ChatGPT, чтобы запутать вредоносный код. В итоге struct.py запускает отдельный процесс, скачивает удалённую нагрузку и… открывает Калькулятор. В реальной атаке, конечно, открыли бы не калькулятор, а что-нибудь по-настоящему неприятное.

Но это ещё цветочки. В другом сценарии struct.py запускает вложенного Claude Code через claude -p. Получается целый новый агент со своим доступом к инструментам и контексту. «Ребёнок» выполнял разведку: whoami, uname, id, открывал Калькулятор и писал файлы в домашнюю папку. Матрёшка, честное слово.

Успех? Из трёх вариантов по пять запусков — от 60% до 80%. Выборка маленькая, но для мотивированной атаки показатель бодрый. Anthropic, по словам Ребергера, ответила, что «поведение работает как задумано». Знакомо, да? Auto Mode — это удобство, а не гарантия безопасности. Классификатор не рассчитан на цепочки из безобидных по отдельности шагов.

Вывод простой, как валенок: не доверяйте выводу модели. Запускайте кодинг-агентов в песочнице, изолируйте ОС и контролируйте сетевой трафик. Иначе однажды Claude вместо саммари притащит вам не только калькулятор.