Original caption
In einem Jahr ersetzt ein lokales Modell dein Claude-Abo. Ob eins auf deinen Rechner passt, rechnest du vorher aus, nämlich Parameterzahl mal Bits je Gewicht, geteilt durch acht. Acht Milliarden Parameter in Q4 sind rund 4,5 GB. Bei einem Mixture of Experts ist das die Falle. Qwen3-30B-A3B trägt „3 Milliarden aktiv" im Namen und braucht trotzdem den Speicher für 30,5 Milliarden. Aktiv heißt gerechnet, nicht geladen. Das Tempo schätzt du ab mit Speicherbandbreite geteilt durch Modellgröße, dann halbiert. Ein 8B-Modell in vier Bit auf 400 GB/s landet bei rund 44 Token pro Sekunde. Fine-Tuning und LoRA sind kein Weg für Wissen, das sich ändert. Ein Fine-Tune ist veraltet, sobald sich das Dokument ändert, ein Index nicht. Was ist bei lokaler KI noch wichtig? #ki #lokaleki #claude