Quantisierung erklärt: Wie man ein 70B-Modell auf normaler Hardware betreibt Ein 70B-Modell braucht in voller Präzision 140 GB VRAM — bis man es quantisiert. Ein praxisnaher Leitfaden zu GGUF, K-Quants, Q4 vs. Q8, dem tatsächlichen Qualitätsver… #quantisierung #modellquantisierung #lokalesllm
Quantisierung erklärt: Wie man ein 70B-Modell auf normaler Hardware betreibt
Ein 70B-Modell braucht in voller Präzision 140 GB VRAM — bis man es quantisiert. Ein praxisnaher Leitfaden zu GGUF, K-Quants, Q4 vs. Q8, dem tatsächlichen Qualitätsverlust und dem genauen VRAM-Bedarf.
alekseialeinikov.com