Aus dem Maschinenraum

EN — English version

Insights

Technische Erfahrungsberichte aus unserer Arbeit mit lokaler KI — Hardware, Modelle, Benchmarks und was davon im Alltag wirklich funktioniert. Mit echten Messwerten statt Marketing.

AI Glossary

KI-Begriffe erklärt

Von A3B bis Zero Point: Nachschlagewerk zu lokalen Sprachmodellen, Quantisierung, Hardware und spekulativem Decoding.

Zum Glossar →

#7 · 35 Milliarden Parameter, drei Milliarden aktiv: Warum Qwen3.6 lokal so schnell ist

Ein Modell mit 35 Milliarden Parametern, rund 150 Token pro Sekunde im Single-Stream-Decode und dafür nur zwei RTX 3090: Diese Kombination hatten wir so nicht erwartet. Auf dem Papier sah Qwen3.6-35B-A3B nach einem weiteren großen Modell aus, das vor allem viel VRAM beansprucht. Im Betrieb wurde...

Lesen →

#6 · Qwen3.5 122B auf acht RTX 3090: Das erste große Modell, das sich wie Infrastruktur anfühlte

Nach zahlreichen Läufen mit Reasoning-Schleifen, unerwarteten Sprachwechseln, schwankenden Ranglisten und Hardwarefehlern, die sich zunächst als Modellprobleme tarnten, war unser Maßstab ziemlich nüchtern geworden: Ein Modell, das gerade noch in 192 GB VRAM passt, ist noch kein brauchbarer...

Lesen →

#5 · HY3 auf 8x RTX 3090: Ein kluges Modell in einem langsamen Körper

Nach unseren langen Versuchen mit MiniMax M2.7 lag Tencent HY3 als nächster Kandidat nahe. Das 295B-A21B-MoE hatte einen guten Ruf bei Coding und Reasoning, ein vielversprechender gemischter GGUF-Quant war lokal verfügbar, und unsere acht GPUs brachten zusammen genug VRAM mit, um den Versuch...

Lesen →

#4 · Was nach 60.000 Tokens passiert: MiniMax M2.7 unter langer Agentenlast

Für den Betrieb mussten wir wissen, wie schnell, kohärent und urteilsstabil ein Modell nach 60.000, 80.000 oder 100.000 tatsächlich aktiven Tokens noch arbeitet. MiniMax M2.7 zeigte uns, dass hoher kurzer Durchsatz und beeindruckende Einzelantworten mit instabilem Langzeitverhalten zusammenpassen können.

Lesen →

#3 · Warum fünf Bit nicht gleich fünf Bit sind: MiniMax M2.7 im Quantisierungs-Praxistest

Ein 4-Bit-Quant war schnell und unbrauchbar, zwei 5-Bit-Quants trennten Welten: warum die nominelle Bitbreite nichts über die Klugheit eines MoE-Quants aussagt — und welcher Hybrid am Ende Geschwindigkeit und Qualität zusammenbrachte.

Lesen →

#2 · Wenn die GPU vom Bus überfahren wird: Strom, Hitze und andere Lektionen aus unserem 8×3090-Rig

450 Watt Idle, Spitzen bis 3,1 Kilowatt, GDDR6X im Sommer und eine GPU, die unter mechanischem Druck vom Bus fällt: die Betriebslektionen aus unserem 8×3090-Rig — inklusive der Diagnosen, die nvidia-smi nicht zeigt.

Lesen →

#1 · Acht RTX 3090, sieben Slots und sehr viele Kabel: So haben wir unser lokales LLM-Rig gebaut

192 GB VRAM aus acht gebrauchten Consumer-GPUs: Bifurkation, vollwertige PCIe-4.0-Riser, vier Netzteile und ein Holzrahmen — was zwischen „acht GPUs besitzen" und „acht GPUs stabil betreiben" wirklich liegt.

Lesen →