Powiedzieli AI, że noszą zielony T-shirt i dostali przepis na kokainę

Atak CoT Forgery naśladuje wewnętrzny styl myślenia modeli LLM, wstrzykując fałszywe rozumowanie w strukturę tagu "think". Skuteczność sięga 60 proc. Podatność działa na wielu modelach, bo eksploituje wadę strukturalną. Zdaniem badaczy obrona to "Whac-a-Mole spotykający Dzień Świstaka".
z- 22
- #
- #
- #
- #
- #
- #











