Nowe modele językowe potrafią same oceniać poprawność swoich odpowiedzi - i robią to lepiej niż człowiek, wykorzystując ciągły rozkład prawdopodobieństwa zamiast punktowej skali. 🤖
Zespół z UC Berkeley i Stanford opracował framework LLM-as-a-Verifier. Zamiast prosić model o wystawienie oceny (np. 1 - 10), oblicza on wartość oczekiwaną z logitów tokena oceniającego, co daje ciągły, bogatszy sygnał. Na SWE-Bench Verified osiąga 78,2% skuteczności, a na Terminal-Bench V2 - 86,5%. Skalowanie powtórzeń i dekompozycja kryteriów
Zespół z UC Berkeley i Stanford opracował framework LLM-as-a-Verifier. Zamiast prosić model o wystawienie oceny (np. 1 - 10), oblicza on wartość oczekiwaną z logitów tokena oceniającego, co daje ciągły, bogatszy sygnał. Na SWE-Bench Verified osiąga 78,2% skuteczności, a na Terminal-Bench V2 - 86,5%. Skalowanie powtórzeń i dekompozycja kryteriów





SecureCROWN to pierwsze rozwiązanie, które łączy weryfikację odporności sieci neuronowych z kryptografią dwustronną (2PC). Zamiast ujawniać parametry czy dane wejściowe, oblicza certyfikowane gwarancje odporności w modelu bezpiecznym. Kluczowy problem - warunkowe operacje w propagacji liniowej - rozwiązano przez zastąpienie rozgałęzień ciągłymi operacjami arytmetycznymi.
źródło: card
Pobierz