ai-assistants

«Мы больше не можем это взломать»: как Anthropic похоронила промпт‑инъекции, но забыла про особенности AI‑агентов

В конце июля, среди множества новостей о Claude Opus 5, я увидел интересный пост создателя Claude Code Бориса Черного. Он рассказывал, что новая модель стала настолько устойчивой к prompt injection (далее PI), что команда Anthropic больше не может продемонстрировать успешную атаку. Модели действительно становятся устойчивее к подобным атакам, а Anthropic уделяет безопасности моделей значительное внимание и регулярно публикует результаты собственных исследований и оценок в этой области. Интерес вызвали именно формулировки: “Opus 5 is our least prompt injectable model yet” “across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully” Это смелые заявления и на этом можно было бы остановиться.

Читать далее →