JamesJoyce
#programista15k #programista25k #it #programowanie #sztucznainteligencja

Zabawne jest to, że nawet taka firma jak Google musi wrzucać klasycznie zmanipulowane wykresy, by udawać ogromny wzrost wydajności Gemini vs GPT4. Oś powinna zaczynać się od zera.

W komentarzu wpis z tt, jak wygląda prawdziwa różnica wg. papera Google, między Gemini a GPT4.
13
  • Najlepsze
  • Wszystkie komentarze
Zarzutkkake
@JamesJoyce to samo było na tvp, kiedy pis miał 1% głosów więcej to skala była wyższa o połowę xd
9
zibizz1
zibizz1
@ly000: Skala tak, ale nadal poszczego;lne elmenty na niej sa zmanioulowane, powinno być tak
9
JamesJoyce
6
ly000
@JamesJoyce: gdzie tu widzisz manipulacje? masz dyskalkulię? jaki sens ma wstawianie wykresów, gdzie różnice są rzędu kilku procent i w skali od 0 nie widać różnicy?
4
AntyKuc
@JamesJoyce: Czemu na tych prezentacjach zawsze są jakieś pierdoły w stylu pograj z AI w kamień papier nożyce, albo wygeneruj prostą stronkę HTML? Gdzie jakiś realny use-case biznesowy?
3
dejvo
dejvo
@kutafonixor:

Co do jakości, Google deklaruje że codealpha 2 jest lepsze niż 90% programistów xD


Z raportu technicznego AlphaCode
3
zibizz1
zibizz1
@JamesJoyce: Zgadzam sie że 90% jest zbyt daleko od 89,8% bo nawet dalej niż 86,4%. Natomiast nie zgadzam się co do doboru skali wykresu. Akurat w tym wypadku pokazywanie cłąych 100% jest bez sensu. Zgadzam się że często powinno byc na Y od 0 a nie jest ale akurat tutaj jest OK.

W tym wypadku 90->99% jest pewnie tak samo trudne jak 99%>99,9%
2
dejvo
dejvo
@JamesJoyce: Przede wszystkim to nie jest wykres wydajności w sensie prędkości, tylko poprawności uzyskanych odpowiedzi, a tu już kilka procent potrafi zrobić różnicę. Z drugiej strony porównują wyniki z wykorzystaniem innych technik otrzymywania odpowiedzi. Wygląda na to, że Google na siłę szukało jakiegoś przypadku, w którym pokaże wyższość Gemini. Wszystkie naciągane wyniki zostaną zweryfikowane w niezależnych testach po udostępnieniu wersji Ultra.
2
ly000
@zibizz1: tak, o to już można się przyczepić.
1
k.....i
@JamesJoyce:
Mhm, historia jak z GPT-4, wspaniale AGI
1
JamesJoyce
@ly000: skale zaczyna się od zera. Różnice tak niewielkie jak ta nie przedstawia się z reguły a wykresie liniowym, tylko w zwykłej tabeli.
1
dejvo
dejvo
@JamesJoyce: Finansowo to się obecnie nie kalkuluje. Wydajnościowo można wszystko oczywiście zrównoleglić, ale koniec końców płacisz za wygenerowanie 1k tokenów. Przyjmując, że AlphaCode2 (GeminiPro) generuje tokeny w cenie porównywalnej do GPT-3.5-turbo i na jedno prawdopodobne rozwiązanie potrzeba nam ~2k tokenów, to koszty będą w okolicy $3000 / finalne rozwiązanie i nadal nie masz pewności, że wynik będzie zadowalający. Możliwe, że za 2-3 lata dostaniemy coś, co będzie potrafiło wygenerować finalne
1