Grok stale coraz głupszy:
https://grok.com/share/bGVnYWN5LWNvcHk_ec22c61c-1229-40a6-b50c-3bde6b7502f5
Od początku założył, że mam złe intencje, i przez to kompletnie spieprzył analizę mojego pytania: zamiast rozważyć, czy detektor może zostać wykorzystany jako element procesu uczenia generatora, zaczął odpowiadać na znacznie węższe pytanie, którego w ogóle nie zadałem. Kiedy wyjaśniłem mu konkretny mechanizm iteracyjnego wykorzystania wyników detektora jako informacji zwrotnej, nadal nie potrafił odnieść się do tego argumentu i w kółko wracał do odmowy dotyczącej DDoS. Nawet
https://grok.com/share/bGVnYWN5LWNvcHk_ec22c61c-1229-40a6-b50c-3bde6b7502f5
Od początku założył, że mam złe intencje, i przez to kompletnie spieprzył analizę mojego pytania: zamiast rozważyć, czy detektor może zostać wykorzystany jako element procesu uczenia generatora, zaczął odpowiadać na znacznie węższe pytanie, którego w ogóle nie zadałem. Kiedy wyjaśniłem mu konkretny mechanizm iteracyjnego wykorzystania wyników detektora jako informacji zwrotnej, nadal nie potrafił odnieść się do tego argumentu i w kółko wracał do odmowy dotyczącej DDoS. Nawet





















Chyba przestane patrzec na te wszystkie benchmarki.
Bo niby GLM5.3 jest dobry. A według mnie pierniczy jak pokręcony....
Deepseek v4 pro też według mnie dużo gorszy do RP niż sie mogłoby wydawać.
@LadySandra: W szczególności chińskie modele są tuningowane pod benchmarki i trzeba patrzeć na to przez palce... Najlepszym benchmarkiem są Twoje zadania/zapytania.
Zrób sobie swój benchmark - to czego potrzebujesz do pracy/zabawy i na tych pytaniach testuj modele :-)
GPT plus, Astra 6 to zwykły marketing. Wróciłem do clauda ponownie po dwóch dniac. W codex nie da się nic zrobić, tokeny przepalają się na prostych rzeczach w 20 minut