Gogle nie wierzył

Skompilowałem llama.cpp bezpośrednio na telefonie za 900 zł z procesorem Helio G88 (6GB RAM) i odpaliłem lokalnie, całkowicie offline model językowy (Llama 3.2 1B).Prędkość generowania to stabilne ~5-8 tokenów na sekundę, a przetwarzanie promptu wyciąga nawet 15 t/s. Wszystko działa w Termuxie bez r
z- 34
- #
- #
- #
- #
- #
- #