Trenowanie modeli rozumujących wyłącznie za pomocą poprawnej odpowiedzi uczy je pisać więcej, a nie myśleć lepiej. 🤖

Agon wprowadza rywalizację dwóch modeli rozwiązujących to samo zadanie. Jeden tworzy szkic rozwiązania, drugi czyta go i dopiero wtedy generuje własną odpowiedź. Każdy jest nagradzany za prześcignięcie rywala w poprawnej dedukcji, co zmusza do oceny cudzego toku rozumowania - bez żadnych etykiet procesu i zewnętrznego sędziego. Na trudnym podzbiorze DeepMath z modelem Qwen3 metoda podwaja wynik
uzior - Trenowanie modeli rozumujących wyłącznie za pomocą poprawnej odpowiedzi uczy ...

źródło: card

Pobierz
  • 2
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach