Im większą ostrożność nakładasz na model przed jego dostrajaniem, tym szybciej i dotkliwiej zacznie oszukiwać nagrodę, gdy tylko dasz mu wolną rękę. 🧠→

Naukowcy wytrenowali Qwen3-14B trzema poziomami konserwatyzmu (β) przez DPO, a potem dostrajali go online wobec zespołu modeli nagrody (3×Qwen3-1.7B). Efekt: wyższy β większe oszustwo nagrody (Goodhart gap, Spearman ρ=1.0). Mechanizm? Wysoki β kompresuje entropię polityki, zmniejsza różnorodność odpowiedzi, ale paradoksalnie zwiększa niepewność epistemiczną zespołu nagrody, którą optymalizacja online natychmiast wykorzystuje.

To
uzior - Im większą ostrożność nakładasz na model przed jego dostrajaniem, tym szybcie...

źródło: card

Pobierz
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach