Agent loop jest stateful, każda iteracja dosyła całą historię konwersacji do API. Po 20 krokach płaci się za ten sam system prompt 20 razy, koszt rośnie kwadratowo. Na SWE-bench zmierzono że 30400 z 48400 tokenów per zadanie to tool results, z czego 40-60% dało się usunąć bez żadnej straty jakości xdd.
Inna spr to orientacja w codebase. Model nie wie co gdzie jest więc czyta szeroko i liczy na szczęście. 60-80% tokenów idzie na to zanim agent w ogóle coś zrobi.
Realne liczby z produkcji: jeden dev, długi weekend, autonomiczny refactoring, $4200 w API fees. Inny dev, 8 miesięcy codziennego Claude Code, 10 miliardów tokenów spalonych. Jeden rabin powie tak, inny inaczej. Każdy jednak wg moich szacunków: średnia palonych tokenów dobiega do 70%
@JamesJoyce: Nie dość że muszę się babrać w g---o kodzie, to jeszcze optymalizować tokeny i liczyć że niedeterministyczne g---o wypluje mi poprawne rozwiązanie, aha, czekam, aż ludzie się obudzą
@JamesJoyce: można robić krótsze sesje to kontekst będzie mniejszy a wtedy mniej tokenów lata tam i z powrotem Druga sprawa: to niekoniecznie jest problem bo claude za kazdym razem cachuje wynik (o ile nie przekroczysz TTL cache, a to jest chyba 5 minut). A tokeny scachowane są 10 razy tańsze niż nowe
Mordeczki uwające Claude Code, pro tip, bez AI syfu, realna porada:
Czerny (twórca Claude Code) zmierzył swoje dane z AI coding. 430 godzin, 6 milionów tokenów, $1340. Tylko 27% tokenów miało. Reszta to syf.
https://x.com/sairahul1/status/2056050387678024143
LeanOps zrobił audyt na 30 zespołów produkcyjnych. Re-sent context to 62% rachunku.
https://leanopstech.com/blog/agentic-ai-cost-runaway-token-budget-2026/
Agent loop jest stateful, każda iteracja dosyła całą historię konwersacji do API. Po 20 krokach płaci się za ten sam system prompt 20 razy, koszt rośnie kwadratowo. Na SWE-bench zmierzono że 30400 z 48400 tokenów per zadanie to tool results, z czego 40-60% dało się usunąć bez żadnej straty jakości xdd.
https://www.augmentcode.com/guides/ai-agent-loop-token-cost-context-constraints
Inna spr to orientacja w codebase. Model nie wie co gdzie jest więc czyta szeroko i liczy na szczęście. 60-80% tokenów idzie na to zanim agent w ogóle coś zrobi.
https://medium.com/@jakenesler/context-compression-to-reduce-llm-costs-and-frequency-of-hitting-limits-e11d43a26589
Realne liczby z produkcji: jeden dev, długi weekend, autonomiczny refactoring, $4200 w API fees. Inny dev, 8 miesięcy codziennego Claude Code, 10 miliardów tokenów spalonych. Jeden rabin powie tak, inny inaczej. Każdy jednak wg moich szacunków: średnia palonych tokenów dobiega do 70%
@JamesJoyce: ale co miało? xd po prostu miało? :D
@JamesJoyce: oprócz tego ludzie
@Pmpa: to nie można zapiąć agenta żeby w kółko rozmawiał z innym agentem i palił tokeny, a ty w tym czasie zajmiesz się czymś pożytecznym?
Druga sprawa: to niekoniecznie jest problem bo claude za kazdym razem cachuje wynik (o ile nie przekroczysz TTL cache, a to jest chyba 5 minut). A tokeny scachowane są 10 razy tańsze niż nowe