Wszystko
Najnowsze
Archiwum
7
W modelach AI toksyczna persona może się wybudzić całkiem niespodziewanie

Badacze fine-tuningowali model na zbiorze zadań związanych z pisaniem niebezpiecznego kodu, a następnie sprawdzali, jak zachowuje się on w pytaniach niezwiązanych z programowaniem. Zamiast ograniczyć się do błędów w pisanym kodzie, model zaczął częściej generować odpowiedzi agresywne i manipulacyjne
z- 0
- #
- #
- #
- #
- #
Naukowcy wytrenowali Qwen3-14B trzema poziomami konserwatyzmu (β) przez DPO, a potem dostrajali go online wobec zespołu modeli nagrody (3×Qwen3-1.7B). Efekt: wyższy β większe oszustwo nagrody (Goodhart gap, Spearman ρ=1.0). Mechanizm? Wysoki β kompresuje entropię polityki, zmniejsza różnorodność odpowiedzi, ale paradoksalnie zwiększa niepewność epistemiczną zespołu nagrody, którą optymalizacja online natychmiast wykorzystuje.
To
źródło: card
Pobierz