Aus dem Maschinenraum
EN — English versionInsights
Technische Erfahrungsberichte aus unserer Arbeit mit lokaler KI — Hardware, Modelle, Benchmarks und was davon im Alltag wirklich funktioniert. Mit echten Messwerten statt Marketing.
AI Glossary
KI-Begriffe erklärt
Von A3B bis Zero Point: Nachschlagewerk zu lokalen Sprachmodellen, Quantisierung, Hardware und spekulativem Decoding.
Zum Glossar →#17 · Qwen 3.8 Flash Next 176B: der belesene Bruder unseres Arbeitspferds
Ein Sprichwort sagt: Chirurgen können viel und wissen nichts, Internisten wissen viel und können nichts. Unser Arbeitspferd, das kleine Qwen 3.8 27B, übernimmt die Rolle des Chirurgen — stark beim Codieren, dünn im Wissen. Qwen3.8-Flash-Next ist deutlich größer und soll die Wissenslücken bei ähnlicher Qualität im Tool-Calling teilweise schließen; gemessen haben wir das allerdings noch nicht. Was wir gemessen haben: 83,9 tok/s bei 100.000 Tokens Kontext, ein Fenster von 524.288 Tokens, auf sechs von zehn Karten. Der Weg von 28,1 tok/s dorthin führte über eine andere Engine, spekulatives Dekodieren und den Befund, dass mehr Karten langsamer sind.
Lesen →#16 · Aufrüsten: Das Monster-Rig mit bis zu 19 GPUs
Unser Inferenz-Rig ist von acht auf zehn RTX 3090 gewachsen, und alle zehn laufen. Möglich macht das ein Dual-Sockel-Board mit 19 Anschlüssen für Grafikkarten, an dem bis zu zehn Karten an einer einzigen CPU hängen können. Der Weg dorthin führte über drei Karten, die wir für tot hielten, zwei Absturzserien und einen Verdacht, den wir selbst hatten: dass die neue Plattform langsamer sei. Sie ist es nicht — nach Speicherausbau und sockellokaler Verkabelung erreichen beide Cluster wieder über 120 tok/s, das Niveau des alten Rigs. Der gemessene Rückstand von 11,7 Prozent stammte aus einem kaputten Zwischenzustand, und keine einzige Karte war defekt.
Lesen →#15 · Ein Modell für das Team: Qwen3.8-27B auf zwei Vierer-Clustern
Qwen3.8-27B bedient bei uns inzwischen mehrere Entwickler gleichzeitig, jeder mit seinen eigenen Coding-Agenten. Dahinter stehen zwei Cluster aus je vier RTX 3090 und ein selbst gebauter Proxy, der Anfragen nach Länge und Auslastung verteilt. Was dafür nötig war, was unter Teamlast gemessen ist — und was ausdrücklich noch nicht.
Lesen →#14 · Eine vollwertige Office-Assistenz auf einer einzelnen GPU: Qwen 3.8 27B
Qwen 3.8 27B steht im Intelligence Index von Artificial Analysis auf Platz eins seiner Größenklasse — stark beim Programmieren und beim Tool-Calling, also genau dort, wo Büroautomatisierung ansetzt. Dieses Modell läuft bei uns im Dauerbetrieb auf einer einzelnen RTX 3090 mit 24 GB, mit rund 58 tok/s auch bei 81.000 Tokens Kontext. Warum vier Bit dafür reichen, was zwölf gemessene Konfigurationen dazu sagen und wo unsere Assistenz im Sekretariat so ein Modell längst einsetzt.
Lesen →#13 · DeepSeek V4 Flash mit TensorSharp: Der Serverpfad steht, die OpenCode-Konfiguration noch nicht
Am Ende von Post 10 gaben wir ein bewusst unspektakuläres Versprechen:
Lesen →#12 · Die sechs Zeichenfolgen, die Laguna nicht schreiben kann
Manche Fehler kosten einen ganzen Arbeitstag, obwohl alle beteiligten Systeme Erfolg melden und sichtbar nichts geschieht.
Lesen →#11 · DeepSeek-V4-Flash auf 8x RTX 3090: eine Million Tokens, aber kein Tensor Parallelism
Ein Modell kann auf acht GPUs laufen. Diese Aussage kann allerdings zwei sehr verschiedene Dinge bedeuten.
Lesen →#10 · Das LLM-Rig aus eBay-Teilen: 2 x RTX 3060, 120 Euro für Board und CPU, 77 tok/s
Unser großes lokales LLM-Rig besteht aus acht RTX 3090, einem EPYC und einer Stromversorgung, mit der man vermutlich auch kleinere Metallarbeiten erledigen könnte. Dort war die Materialschlacht Teil der Aufgabe. Diesmal wollten wir das Gegenteil wissen: Wie billig darf ein lokaler LLM-Rechner...
Lesen →#9 · Drei Modelle, acht GPUs: Wie wir 192 GB VRAM sinnvoll aufteilen
Bei lokaler Inferenz dreht sich vieles um eine Frage: Wie bekommen wir dieses eine große Modell zum Laufen? Ein Modell, alle acht GPUs, TP=8, fertig. Für das erste Foto vom laufenden Server ist das eine gute Geschichte.
Lesen →#8 · Laguna S 2.1 INT4 auf 8×3090: Der schnelle Spezialist mit scharfen Kanten
Die meisten Modelle auf unserem 8x3090-Rig landeten bisher in einem von zwei Lagern: HY3 war klug und quälend langsam, frühe MiniMax-Quants waren schnell und fachlich nicht immer auf der Höhe. Wie sich diese Unterschiede unter langer Agentenlast auswirken, haben wir im Vergleich von MiniMax, HY3...
Lesen →