Lokale KI im Unternehmen: KI-Coding mit eigenem LLM statt Cloud
Die meisten KI-Coding-Werkzeuge schicken Ihren Quellcode an einen Anbieter in der Cloud. Für viele Teams ist das der Grund, warum KI im Entwicklungsalltag ausgebremst wird: Der Code ist zu sensibel, um das Haus zu verlassen. Lokale KI dreht das um. Das Modell läuft auf Ihrer Hardware, die Daten bleiben im eigenen Netz. Hier ist die ehrliche Einordnung, was heute geht, was nicht und für wen sich der Weg lohnt.
Warum überhaupt lokal?
Der stärkste Grund ist Datenhoheit. Bei einem lokalen Modell verlässt weder Ihr Quellcode noch ein Prompt oder ein Kundendatensatz das eigene Netz. Es gibt keinen externen Dienst, der die Daten sieht, keine Drittland-Übermittlung und keine Diskussion über einen Auftragsverarbeitungsvertrag für diesen einen Datenfluss. Für Branchen mit strengen Vorgaben, für schützenswertes geistiges Eigentum oder für Umgebungen ohne Internetzugang ist das oft die Bedingung, unter der KI überhaupt eingesetzt werden darf.
Dazu kommen 2 praktische Gründe. Das Kostenmodell ist ein anderes: Statt pro Anfrage zu zahlen, investieren Sie einmal in Hardware und betreiben sie danach. Bei hohem, gleichmäßigem Verbrauch rechnet sich das über die Zeit. Und die Kontrolle liegt bei Ihnen: kein stiller Modellwechsel des Anbieters und keine Ratenbegrenzung mitten in der Arbeit. Auch eine Preisliste, die sich ändert, trifft Sie nicht.
Was „lokal" konkret heißt
Lokale KI bedeutet, dass ein Sprachmodell mit offenen Gewichten auf Ihrer eigenen Maschine läuft: auf einer Entwickler-Workstation, auf einem Server im Rechenzentrum oder in einer abgeschotteten Umgebung ganz ohne Internetzugang. Ein schlankes Server-Programm lädt das Modell und stellt es den Werkzeugen bereit, meist über dieselbe Schnittstelle, die auch die großen Anbieter nutzen. Für das Editor- oder Coding-Werkzeug ändert sich damit fast nichts, außer der Adresse, die es anspricht.
Die Bausteine dafür sind heute reif und komplett quelloffen. Als Laufzeit für das Modell hat sich Ollama etabliert, als Code-Modelle die offene Qwen-Familie in Größen von 7B bis 35B, im Editor das Werkzeug Continue und im Terminal Aider, das agentisch arbeitet und jeden KI-Schritt als nachvollziehbaren Git-Commit ablegt. Weil diese Laufzeit dieselbe Schnittstelle spricht wie die großen Anbieter, lassen sich sogar gewohnte Werkzeuge wie Claude Code weiter nutzen, nur gegen das eigene Modell gerichtet statt gegen die Cloud. Der Punkt ist nicht das einzelne Werkzeug, sondern das Prinzip: Das Modell gehört Ihnen, nicht einem Anbieter.
2 Wege: eigene Hardware oder ein Server im Rechenzentrum
„Lokal" heißt nicht zwingend, dass ein Server bei Ihnen im Keller steht. Entscheidend ist nicht der Ort, sondern die Kontrolle: Das Modell gehört Ihnen und niemand außer Ihnen sieht die Daten. Dafür gibt es 2 Wege.
Der erste ist eigene Hardware im Firmennetz. Sie kaufen einen Server mit passender Grafikkarte und betreiben ihn selbst. Das gibt maximale Kontrolle und funktioniert sogar in abgeschotteten Umgebungen ganz ohne Internet. Der Preis dafür ist die einmalige Investition und ein Stück Betrieb im eigenen Haus.
Der zweite Weg ist für viele Firmen der bessere: eine dedizierte GPU-Instanz in einem deutschen Rechenzentrum. Sie mieten die Rechenleistung auf eigenen Namen. Das Modell und Ihre Daten bleiben Ihre. Das ist ausdrücklich kein Cloud-KI-Dienst wie Copilot oder ChatGPT, bei dem ein Anbieter Ihre Prompts mitliest. Es ist Ihr eigener Server, nur steht das Blech nicht bei Ihnen, sondern beim Rechenzentrumsbetreiber. Sie sparen sich den Hardware-Kauf, zahlen planbar pro Monat und behalten trotzdem die volle Datenhoheit, weil weder ein US-Dienst noch ein Modellanbieter Ihre Daten zu sehen bekommt.
Für die meisten Teams ist dieser zweite Weg der pragmatische Einstieg: die Datenhoheit einer lokalen Lösung, ohne selbst Hardware kaufen und pflegen zu müssen.
Warum ein EU-Standort allein nicht reicht
Ein Punkt, den viele übersehen: Wo die Daten liegen, ist nicht dasselbe wie die Frage, wer rechtlich Zugriff hat. Der 2018 in Kraft getretene US-amerikanische CLOUD Act verpflichtet US-Unternehmen zur Herausgabe angeforderter Daten an US-Behörden, auch wenn die Server in der EU stehen. Wie real das ist, zeigte Microsoft im Juni 2025: Vor dem französischen Senat räumte der Konzern ein, die Herausgabe von in Frankreich gespeicherten Daten an US-Behörden nicht ausschließen zu können. Ein Rechenzentrum in Frankfurt, das einem US-Konzern gehört, schützt also nicht zuverlässig.
Das betrifft auch die als souverän vermarkteten Angebote. AWS betreibt seit Januar 2026 eine europäische Souveränitäts-Cloud mit deutscher Region, bleibt als US-Konzern aber in der Reichweite des CLOUD Act. Und im November 2025 stuften die EU-Aufsichtsbehörden gerade Amazon Web Services, Microsoft und Google als kritische Dienstleister ein, im Rahmen von DORA, einer EU-Regel für die IT-Sicherheit von Banken und Versicherern. Die Frage nach echter Datenhoheit steht also längst bei Aufsehern und Vorständen auf der Tagesordnung.
Deshalb zählt bei der zweiten Variante der Anbieter und nicht nur der Standort: ein Rechenzentrumsbetreiber unter deutscher Jurisdiktion ohne US-Mutterkonzern. Ein Nachweis wie BSI C5, ein Cloud-Sicherheitstestat des zuständigen Bundesamts, ist bei Banken, Versicherern und im Gesundheitswesen oft ohnehin Vertragsvoraussetzung. Ohne ihn kommt man dort gar nicht erst ins Gespräch.
KI-Coding mit lokalem LLM: was heute wirklich geht
Hier ist die ehrliche Nachricht, in beide Richtungen. Offene Modelle sind in den letzten Monaten deutlich besser geworden, gerade beim Programmieren. Für den Großteil des Alltags reicht das heute aus:
- Code erzeugen und erklären: Funktionen schreiben, fremden Code verständlich machen, Fehler suchen.
- Refactoring und Tests: bestehenden Code umbauen, Testfälle vorschlagen, Randfälle finden.
- Wiederkehrende Fleißarbeit: Boilerplate, Datenmodelle, kleine Skripte, Dokumentation.
Und hier ist die andere Hälfte, die Ihnen die Anbieter offener Modelle selten so deutlich sagen: Bei den härtesten Aufgaben liegen die führenden Cloud-Modelle weiter vorne. Bei langem agentischem Arbeiten über viele Dateien, komplexem Schlussfolgern über eine große Codebasis und dem Zusammenhalten eines Plans über viele Schritte ist ein Spitzenmodell wie Claude weiterhin zuverlässiger. Der Abstand ist kleiner geworden, verschwunden ist er nicht.
Diese Grenze zeige ich im Kurs bewusst: Ein großer Umbau über viele Dateien hinweg bringt ein kleines lokales Modell an sein Limit. Dort ist die ehrliche Antwort ein enger geschnittener Auftrag oder der Wechsel in die Cloud. In der Praxis führt das selten zu einem Entweder-oder, sondern zu einem bewussten Mix. Das Sensible und das Alltägliche läuft lokal, das Schwerste bei Bedarf in der Cloud. Wer diese Grenze kennt und sauber zieht, holt aus lokaler KI heute schon einen echten Produktivitätsgewinn heraus, ohne sich etwas vorzumachen.
Die ehrliche Abwägung: lokal gegen Cloud
Bleibt die Grundsatzfrage: das eigene Modell, ob im Haus oder im EU-Rechenzentrum, gegen den fertigen Cloud-KI-Dienst. Beide haben ihren Preis, nur an unterschiedlicher Stelle:
| Kriterium | Eigenes Modell (Haus oder EU-RZ) | Cloud-KI-Dienst (z. B. Claude) |
|---|---|---|
| Datenhoheit | Daten bleiben unter Ihrer Kontrolle | Daten gehen an den Anbieter |
| Kosten | Eigene Hardware oder Miete im EU-RZ | Pro Anfrage, ohne Vorabinvestition |
| Leistung bei harten Aufgaben | Gut und schnell besser werdend | Aktuell noch führend |
| Aufwand und Betrieb | Setup und Pflege, im Haus oder gemietet | Nichts zu betreiben |
| Offline und abgeschottet | Möglich mit eigener Hardware | Braucht eine Verbindung |
Für wen sich lokale KI lohnt
Der Weg ins Haus rechnet sich nicht für jeden gleich. Klar dafür sprechen:
- Regulierte Branchen und sensibler Code: Behörden, Banken, Gesundheitswesen oder Betriebe, deren Betriebsvereinbarung Copilot, ChatGPT und Claude ausschließt, während der Code trotzdem im Haus bleiben soll.
- Abgeschottete Umgebungen: Entwicklung ohne oder mit stark eingeschränktem Internetzugang.
- Hoher, gleichmäßiger Verbrauch: wenn ein Team KI täglich intensiv nutzt und die Abrechnung pro Anfrage spürbar wird.
Und ebenso ehrlich, wogegen es spricht: Ein kleines Team mit gelegentlichem Bedarf und unkritischen Daten fährt mit einem Cloud-Dienst meist einfacher und günstiger. Lokale KI kostet Hardware und ein Stück Betrieb. Dieser Aufwand muss durch echten Bedarf gedeckt sein, sonst löst man ein Problem, das man gar nicht hat.
KI-Coding im Team einführen, ob lokal oder in der Cloud
Im KI-Coding-Workshop lernt Ihr Entwicklungsteam, KI-Assistenz produktiv und mit klarem Kopf einzusetzen. Auf Wunsch mit dem Fokus auf lokalen Modellen und Datenschutz.
Wie ich dabei helfe
Lokale KI ist mein aktueller Schwerpunkt. Ich unterrichte KI-Coding als Dozent an der GFU Cyrus AG in Köln, betreibe offene Modelle in der eigenen Umgebung und habe daraus einen eigenen 2-tägigen Kurs aufgebaut, in dem Teams die komplette Werkzeugkette auf echtem Code aufbauen. Das heißt: Ich rede hier nicht über Folien, sondern über das, was auf echter Hardware läuft und wo es im Alltag hakt.
Daraus wächst gerade ein zweiter Baustein neben der Schulung. Unternehmen, die lokale KI nicht nur verstehen, sondern betreiben wollen, möchte ich den Weg dorthin ebnen: die passende Instanz in einem deutschen Rechenzentrum einrichten, Ihre Coding-Werkzeuge anbinden und das Team schulen. Die Absicherung im Netz und den laufenden Betrieb übernimmt Ihre IT, ich sage dabei, was der Modell-Server braucht. Der Gedanke ist derselbe wie bei der Schulung: erst gemeinsam aufsetzen, dann das Wissen übergeben, damit Sie nicht von mir abhängig bleiben.
Häufige Fragen
Ist lokale KI DSGVO-konform?
Lokale KI macht Datenschutz deutlich einfacher, weil weder Quellcode noch Prompts oder Kundendaten das eigene Netz verlassen. Es gibt keinen externen Anbieter, an den Daten gehen, also keine Drittland-Übermittlung und keinen Auftragsverarbeitungsvertrag für diesen Datenfluss. Die Pflichten zu Zugriff, Protokollierung und Löschung bleiben bestehen, liegen dann aber vollständig in Ihrer Hand.
Kann ein lokales LLM mit Claude oder GPT mithalten?
Für viele alltägliche Coding-Aufgaben ja. Bei den härtesten Aufgaben, langem agentischem Arbeiten und komplexem Schlussfolgern, liegen die führenden Cloud-Modelle weiter vorne. In der Praxis läuft es deshalb oft auf einen bewussten Mix hinaus: sensibles und alltägliches lokal, das Schwerste in der Cloud.
Welche Hardware braucht man dafür?
Das hängt an der Modellgröße und am Weg. Kleinere Coding-Modelle laufen auf einer guten Workstation mit moderner Grafikkarte, größere Modelle und Team-Betrieb brauchen einen Server mit genug Grafikspeicher, im eigenen Haus oder als gemietete GPU-Instanz im Rechenzentrum. Der Grafikspeicher ist wichtiger als reine Rechenleistung. Eine dedizierte GPU-Instanz kostet je nach Ausbau einige hundert bis wenige tausend Euro im Monat und rechnet sich erst als Team-Angebot, nicht für einen einzelnen Entwickler. Sinnvoll ist, klein zu starten, den echten Bedarf zu messen und die Hardware daran auszurichten.
Muss die Hardware im eigenen Haus stehen?
Nein. Sie haben 2 Möglichkeiten: eigene Hardware im Firmennetz oder eine gemietete GPU-Instanz in einem deutschen Rechenzentrum. In beiden Fällen gehört das Modell Ihnen und niemand außer Ihnen sieht die Daten. Beim gemieteten Weg zählt der Anbieter: ein Rechenzentrum unter deutscher Jurisdiktion ohne US-Mutterkonzern, weil der US-amerikanische CLOUD Act US-Firmen auch für Server in Europa zur Datenherausgabe verpflichten kann.
Souveräne KI im eigenen Rechenzentrum aufbauen?
Ich richte Ihnen ein eigenes Modell auf einer dedizierten GPU-Instanz im deutschen Rechenzentrum ein, binde Ihre Werkzeuge an und schule Ihr Team. Die Absicherung im Netz und den Betrieb übernimmt Ihre IT.