Lokale KI bedeutet: Das Sprachmodell läuft auf Hardware, die Ihrem Unternehmen gehört oder exklusiv für Sie betrieben wird. Anfragen, Dokumente und Antworten bleiben im eigenen Netz. Nichts geht an einen Dienst in Kalifornien, nichts liegt unterwegs in einer Infrastruktur, über die Sie im Ernstfall keine Auskunft geben können. Dahinter steckt ein lokales LLM – ein Sprachmodell, das Sie einmal herunterladen und dann behalten –, dazu ein Server, der es im Haus bereitstellt, und je nach Anwendungsfall eine Anbindung an Ihre eigenen Dokumente.
Bis vor kurzem war das eine akademische Option. Die frei verfügbaren Modelle lagen weit hinter den großen Cloud-Diensten, und die passende Hardware kostete so viel, dass sich die Frage von selbst erledigte. Seitdem hat sich beides bewegt: Offene Modelle sind von Generation zu Generation brauchbarer geworden, und Hardware mit genügend Videospeicher ist in einer Preisklasse angekommen, die ein Pilotprojekt trägt. Wir messen diese Entwicklung selbst nach.
Gleichzeitig ist die Datenschutzfrage konkreter geworden. Wer Mandantenakten, Patientendaten, Gehaltslisten oder unveröffentlichte Konstruktionsdaten verarbeitet, kann sie nicht in ein Chatfenster kopieren, dessen Verarbeitungskette im Zweifel nicht prüfbar ist. On-Premise-KI und souveräne KI sind deshalb in vielen Häusern die praktische Antwort auf eine Freigabefrage, die längst gestellt wurde.
Wann lokale KI die richtige Wahl ist

Nicht jedes Unternehmen braucht eigene Hardware. Es gibt aber wiederkehrende Konstellationen, in denen KI ohne Cloud die tragfähigere Variante ist:
- Daten, die das Haus nicht verlassen dürfen. Personalakten, Verträge in Verhandlung, Prüfberichte, Forschungsdaten. Wenn die Antwort auf „Wo liegt das während der Verarbeitung?“ Teil der Freigabe ist, wird der Speicherort zum Auswahlkriterium.
- Berufsgeheimnis. § 203 StGB stellt die Offenbarung fremder Geheimnisse unter Strafe und knüpft die Mitwirkung Dritter an Bedingungen. Für Kanzleien, Praxen und Steuerberatungen verschiebt das die Diskussion von „Welches Tool ist am besten?“ zu „Wer bekommt die Daten überhaupt zu sehen?“. Lokale Verarbeitung reduziert den Kreis der Beteiligten. Rechtsberatung ist das ausdrücklich nicht; die Prüfung gehört zu Ihrem Berufsrecht und Ihrem Datenschutzbeauftragten.
- Konzernrichtlinien, die Cloud-KI ausschließen. In vielen Häusern ist die Nutzung externer KI-Dienste per Richtlinie untersagt oder auf einen kleinen Positivkatalog beschränkt. Eine eigene Installation bleibt innerhalb dieser Vorgaben.
- Kostenkontrolle bei Dauerlast. Nutzungsabhängige Abrechnung ist günstig, solange die Nutzung sporadisch bleibt. Läuft dagegen jeden Tag dieselbe Verarbeitung über tausende Dokumente, wächst die Rechnung mit dem Erfolg des Projekts. Eigene Hardware kostet einmalig plus Strom und Betreuung, unabhängig davon, wie viele Anfragen darüber laufen.
Die Unternehmensgröße ist dabei kein Kriterium. Auch ein kleines Team ist mit einer einzelnen Grafikkarte gut bedient, wenn seine Daten im Haus bleiben sollen und seine Abläufe unabhängig von fremden Anbietern laufen müssen. Den Ausschlag gibt nicht die Menge, die verarbeitet wird, sondern die Frage, wem Daten und Abläufe gehören sollen.
Souveränität: Wer über Ihren KI-Zugang entscheidet
Viele Unternehmen entscheiden sich für lokale KI, ohne dass eine Vorschrift sie dazu zwingt. Der Grund ist nüchtern: Wer einen Cloud-Dienst fest in einen Geschäftsprozess einbaut, macht diesen Prozess von Entscheidungen abhängig, an denen er nicht beteiligt ist – von den Produktplänen eines fremden Anbieters und von der Regulierung eines fremden Staates.
Ein solcher Zugang kann durch eine Anbieterentscheidung enden, durch eine Preiserhöhung unwirtschaftlich werden, durch Exportkontrollen eingeschränkt oder von der politischen Großwetterlage eingeholt werden. Im ungünstigen Fall passiert das über Nacht, und der darauf gebaute Prozess steht. Wie wahrscheinlich der einzelne Fall ist, lässt sich schwer schätzen. Die Folge ist in allen vier Fällen dieselbe.
Ein lokal gespeichertes Modell kann niemand zurückrufen. Die Modelldatei auf der eigenen Platte bleibt Byte für Byte dieselbe: Kein stilles Update verändert das Verhalten mitten im Betrieb, keine Abkündigung erzwingt einen Umstieg, und ein Arbeitsablauf, der heute funktioniert, funktioniert morgen genauso. Das ist Betriebssicherheit im wörtlichen Sinn – was einmal läuft, gehört einem. Wo Ergebnisse dokumentiert oder später nachvollzogen werden müssen, wiegt dieser Punkt besonders schwer.
Was wir liefern
Potenzialanalyse

Zuerst klären wir, welche Aufgaben in Ihrem Haus überhaupt ein Sprachmodell brauchen und welche davon lokal sinnvoll laufen. Daraus ergeben sich die technischen Anforderungen: Umfang der Dokumente, Antwortzeit, Zahl gleichzeitiger Nutzer, Anbindung an vorhandene Dateiablagen. Ohne diesen Schritt kauft man Hardware für ein Gefühl.
Hardware-Dimensionierung
Der Videospeicher entscheidet, welches Modell überhaupt läuft; alles Weitere folgt daraus. Wir dimensionieren vom Anwendungsfall her und setzen dabei standardmäßig auf neue, betriebstaugliche Hardware. Wie genau sich der Bedarf im Voraus bestimmen lässt, haben wir an einem eigenen Messaufbau durchgerechnet und veröffentlicht.
Modellauswahl mit eigenen Messungen

Öffentliche Ranglisten beantworten selten die Frage, die Sie haben. Wir testen die infrage kommenden Modelle auf der vorgesehenen Hardware und, wo möglich, an Ihren eigenen Aufgaben: Antwortqualität, Tempo, Speicherbedarf, Verhalten bei langen Dokumenten. Sie bekommen eine Empfehlung, deren Begründung Sie nachlesen können.
Betrieb und Pflege
Ein lokales System, das niemand anfasst, bleibt wie es ist. Das Modell auf der eigenen Maschine aktualisiert sich nicht von selbst. Die laufende Pflege fällt entsprechend klein aus und besteht aus dem, was Ihre IT ohnehin für jeden Server tut: Zugriffsrechte vergeben, Datensicherung prüfen, den Rechner im Blick behalten.
Etwas Neues gibt es, wenn Sie es wollen – ein größeres Modell, ein weiterer Anwendungsfall. Dann planen wir den Schritt, testen ihn vorher und setzen ihn zu einem Termin um, der in Ihren Kalender passt und nicht in den eines Anbieters. Auf Wunsch übernehmen wir diese Pflege ganz oder übergeben den Betrieb dokumentiert an Ihre IT.
Messwerte statt Versprechen
Unsere Angaben zu Tempo und Umfang stammen aus eigenen Messungen, die wir vollständig veröffentlicht haben. Zwei Größenordnungen daraus, grob gerechnet und bewusst vorsichtig gerundet:
- Tempo. Auf Hardware für wenige hundert Euro schreibt ein Modell seine Antwort um ein Vielfaches schneller, als ein Mensch sie mitlesen kann. Im Büroalltag heißt das: Man liest, während die Maschine noch schreibt.
- Umfang. Dieselbe Klasse von Systemen behält mehrere hundert Seiten gleichzeitig im Blick, also etwa den Inhalt eines gut gefüllten Aktenordners. Auch bei dieser Menge bleibt die Antwort schneller, als man mitliest.
Ihre IT-Fachleute können jede dieser Angaben nachprüfen. Der Messbericht zum Einstiegssystem und der Bericht zum System mit einer einzelnen Grafikkarte enthalten die vollständigen Zahlen samt Messbedingungen, unser Fachglossar erklärt die Begriffe, die darin vorkommen. Für Ihre Entscheidung müssen Sie nichts davon gelesen haben. Es steht dort, damit niemand uns auf Zuruf glauben muss.
Die Werte gelten für die dort beschriebenen Systeme und lassen sich nicht ohne Weiteres auf eine andere Zusammenstellung übertragen. Deshalb messen wir vor jeder Empfehlung in Ihrer Umgebung nach. Und bevor Sie beschaffen, beantwortet die Potenzialanalyse die Frage, die am Anfang zählt: Was genau soll die Maschine können?
Häufige Fragen
Was bedeutet „KI ohne Cloud“ konkret?
Das Modell, der Server, der es bereitstellt, und Ihre Daten liegen auf Maschinen in Ihrem Netz. Eine Anfrage geht vom Arbeitsplatz an den eigenen Server und kommt von dort zurück; nach außen fließt dabei nichts. Updates laden Sie bewusst herunter, statt sie über Nacht zu bekommen. Für den laufenden Betrieb brauchen Sie keine Internetverbindung, nur für die Pflege. Zugriffskontrolle und Backups liegen damit ebenfalls bei Ihnen.
Ist lokale KI so leistungsfähig wie ChatGPT?
Bei den anspruchsvollsten Aufgaben nicht. Die größten Cloud-Modelle sind um ein Vielfaches umfangreicher, als in eine bezahlbare Maschine passt, und liegen bei langem, mehrstufigem Schlussfolgern vorn. Für den Alltag im Unternehmen – zusammenfassen, entwerfen, klassifizieren, Fragen an eigene Dokumente – erreichen offene Modelle in passender Größe brauchbare Qualität. Ob das für Ihren Fall reicht, zeigt erst ein Test an Ihren eigenen Aufgaben und Dokumenten.
Was kostet lokale KI für ein Unternehmen?
Pauschalpreise wären geraten, deshalb nennen wir keine. Die Größenordnung bestimmen der Speicher der Grafikkarte, die Zahl gleichzeitiger Nutzer, der Umfang der Dokumente, der Verfügbarkeitsanspruch sowie Strom und Betreuung. Der Einstieg beginnt niedrig: Hardware für wenige hundert Euro trägt bereits ein Modell, das schneller antwortet, als ein Mensch mitlesen kann. Nach oben skaliert die Ausstattung mit dem Anwendungsfall. Die genauen Messwerte stehen in unseren öffentlichen Berichten; belastbare Zahlen für Ihr Projekt entstehen, sobald er feststeht.
Brauchen wir eigene GPU-Server?
Nicht zwingend. Für einen Piloten mit wenigen Nutzern genügt oft eine einzelne Workstation mit passender Grafikkarte. Ein Server im Rack lohnt sich, sobald mehrere Abteilungen gleichzeitig zugreifen, feste Verfügbarkeiten zugesagt sind oder der Betrieb in die reguläre IT-Landschaft gehört. Eine Zwischenstufe ist dedizierte Hardware in einem deutschen Rechenzentrum: physisch getrennt, aber weiterhin mit einem Dienstleister im Spiel, der vertraglich eingebunden werden muss.
Ist lokale KI automatisch DSGVO-konform?
Nein. Lokaler Betrieb erledigt zwei häufige Probleme: die Übermittlung in Drittländer und die Weiterverarbeitung durch einen Anbieter. Alles andere bleibt Ihre Aufgabe – Rechtsgrundlage, Verarbeitungsverzeichnis, Zweckbindung, Löschkonzept, Rollen- und Rechtevergabe, gegebenenfalls Datenschutz-Folgenabschätzung und Beteiligung des Betriebsrats. Ein Modell, das personenbezogene Daten aus Ihren Ablagen liest, braucht dieselbe Kontrolle wie jedes andere System mit diesem Zugriff.
Dürfen Kanzleien und Arztpraxen lokale KI nutzen?
Wir geben keine Rechtsauskunft, und die Frage ist von der Kanzlei oder Praxis selbst zu klären. Fachlich lässt sich sagen: § 203 StGB knüpft die Einbeziehung Dritter an Bedingungen, und lokale Verarbeitung hält den Kreis der Beteiligten klein, weil keine Inhalte an einen externen Dienst gehen. Berufsrecht, Kammervorgaben, Verschwiegenheitsverpflichtungen und die Dokumentation der Verarbeitung bleiben davon unberührt und sollten vor der Einführung geprüft werden.