Wpis z mikrobloga

@Famine: taki qwenik bez problemu będzie działał.

3-3,5 GB przy 4k kontekstu, ponad 4 GB jak rozjedziesz kontekst do 8-16k. Na telefonie z 8 GB RAM chodzi bez problemu, na 6 GB zadziała, ale iOS potrafi ubić apkę przy dłuższej sesji, więc polecam skwantyzować KV cache do Q8 albo Q4
  • Odpowiedz
@JamesJoyce

@Famine: taki qwenik bez problemu będzie działał.


3-3,5 GB przy 4k kontekstu, ponad 4 GB jak rozjedziesz kontekst do 8-16k. Na telefonie z 8 GB RAM chodzi bez problemu, na 6 GB zadziała, ale iOS potrafi ubić apkę przy dłuższej sesji, więc polecam skwantyzować KV cache do Q8 albo Q4


O to sobie muszę przetestować. Dzięki
  • Odpowiedz
@JamesJoyce: ja za jakiś czas będę testować LiteRT na moim Dimensity 9500 z 16GB LPDDR5X bezpośrednio na NPU. Tylko tutaj więcej zabawy, bo trzeba samemu sobie skompilować pod odpowiednie SDK. PocketPal z tego co pamiętam to inferencja na CPU albo GPU przez OpenCL/Vulkan, więc prefill nie będzie tak dobry. Wąskie gardło to i tak będzie generowanie tokenów ( ͡° ͜ʖ ͡°)
  • Odpowiedz
  • 0
@vindeleonis: nie do końca się zgadzam że wąskie gardło to generowanie tokenów. Przy dłuższym kontekście prefill na CPU/GPU przez OpenCL/Vulkan potrafi być gorszy properties niż decode, bo compute-bound matmul na mobilnym GPU bez dobrego wsparcia dla batched attention skaluje się fatalnie z długością kontekstu. NPU faktycznie to zmienia, bo ma dedykowany silicon pod właśnie te operacje, więc ciekawe ile realnie zyskasz na prefillu względem GPU delegate.
  • Odpowiedz