DFlash Speculative Decoding: Wie ein kleines Modell große KI-Inferenz beschleunigt
DFlash nutzt Block-Diffusion, um mit einem kleinen Draft-Modell die KI-Inferenz um den Faktor 5 oder mehr zu beschleunigen – ohne Qualitätsverlust. Was das für Hardware-Effizienz und Self-Hosting bedeutet.

