Was ist GPTQ? Grundlagen der Post-Training-Quantisierung für LLMs
GPTQ (Generative Pre-trained Transformer Quantization) ist ein Verfahren zur Komprimierung großer Sprachmodelle nach dem Training – ohne dass das Modell erneut trainiert werden muss. Das Ziel: Ein Modell, das ursprünglich 60 GB oder mehr Speicher benötigt, wird so komprimiert, dass es...
