Спящие агенты в LLM: миф или реальная угроза ИИ-безопасности?
Исследователи Anthropic показали, что LLM можно обучить скрывать вредоносное поведение, активируемое по триггеру. Такие «спящие агенты» проходят все стандартные процедуры safety-тренировки —...