Open Source KI: Modelle, Lizenzen und der Rechtsrahmen für Unternehmen

Open Source KI ► ✓ Lizenzen von Llama bis Mistral ✓ Pflichten nach EU AI Act ✓ Erfahrungen aus dem lokalen Betrieb

Roboterhände halten eine Glasscheibe mit dem Leuchtschriftzug Open Source

Anzeige | Partnerbeitrag von SEQIS

Open Source KI meint Modelle und Werkzeuge, deren Bestandteile offenliegen und die Sie nutzen, verändern und weitergeben dürfen. Der Begriff klingt eindeutig. Er steht in der Praxis für vier verschiedene Dinge, die auf vier verschiedenen Ebenen liegen.

Wer im Unternehmen darüber entscheidet, stolpert genau darüber. Eine Suche nach dem Begriff liefert mal Programmbibliotheken für Entwickler, mal fertige Chatbots zum Herunterladen. Beides trägt denselben Namen und hat wenig miteinander zu tun.

Eine Auswertung der Linux Foundation, in Auftrag gegeben von Meta, kommt auf 89 Prozent: So viele Organisationen mit KI-Einsatz nutzen dabei Open-Source-Komponenten. 63 Prozent arbeiten direkt mit einem offenen Modell. Den Auftraggeber sollten Sie mitdenken, die Richtung dürfte stimmen. Für die meisten Unternehmen lautet die Frage also nicht mehr, ob offene KI zum Einsatz kommt. Sie lautet: auf welcher Ebene und unter welcher Lizenz.

Dieser Beitrag sortiert die Ebenen, ordnet die Lizenzen ein und klärt, was die KI-Verordnung von Ihnen verlangt.

Das Wichtigste in Kürze

Open Source KI ist nicht gleich Open Source Modell.
Anwendungen, Laufzeitumgebungen, Modelle und Frameworks sind vier verschiedene Ebenen – mit eigenen Lizenzen und Verantwortlichkeiten.

Open Weights ist nicht automatisch Open Source.
Herunterladbare Modellgewichte allein reichen nach der Definition der Open Source Initiative nicht aus.

Die Lizenz gehört zum Modell, nicht zur Modellfamilie.
Selbst innerhalb von Mistral, Qwen oder anderen Familien können unterschiedliche Bedingungen gelten.

Lokaler Betrieb schützt sensible Daten, verlagert aber Verantwortung ins eigene Haus.
Hardware, Updates, Sicherheitslücken und Administration gehören in die Kostenrechnung.

Der EU AI Act macht keine pauschale Ausnahme für Open Source KI.
Welche Pflichten ein Unternehmen treffen, hängt vor allem vom konkreten Einsatzzweck und der eigenen Rolle ab.

Was versteht man unter Open Source KI?

Bei klassischer Software ist die Lage einfach. Der Quellcode liegt offen, und eine Lizenz erlaubt jedem, ihn zu nutzen und verändert weiterzugeben. Bei KI reicht das nicht, denn ein Modell hat drei Bestandteile: den Code, die trainierten Gewichte und die Daten, aus denen es gelernt hat. Eine Lizenz deckt meist nur einen davon ab. Wer die Gewichte herunterladen darf, weiß deswegen noch nicht, womit das Modell trainiert wurde.

Die Open Source Initiative hat deshalb im Oktober 2024 die Open Source AI Definition in Version 1.0 vorgelegt. Sie verlangt, dass Sie ein Modell nutzen, untersuchen, verändern und weitergeben dürfen. Außerdem müssen Sie genug über die Trainingsdaten erfahren, um das Ergebnis im Prinzip nachbauen zu können. Nur wenige Modelle erfüllen das vollständig.

Worin unterscheiden sich Open Weights und Open Source?

Viele bekannte Modelle sind Open Weights. Sie laden die trainierten Gewichte herunter und betreiben das Modell selbst. Die Trainingsdaten bleiben unter Verschluss, und die Lizenz zieht Grenzen.

Die Llama 4 Community License verlangt eine Sonderlizenz von Meta, sobald ein Dienst zum Erscheinungsdatum der Modellversion mehr als 700 Millionen monatlich aktive Nutzer erreicht. Für den deutschen Mittelstand spielt diese Schwelle keine Rolle. Zwei andere Klauseln derselben Lizenz schon: Abgeleitete Modelle müssen den Namensbestandteil Llama tragen und einen Hinweis „Built with Llama“ zeigen. Und bei den multimodalen Llama-4-Modellen räumt Meta Unternehmen mit Hauptsitz in der Europäischen Union die Rechte ausdrücklich nicht ein. Wer in Deutschland sitzt und Bild oder Audio verarbeiten will, scheidet damit aus.

Wer im Einkauf oder in der Revision eine Liste offener Komponenten führt, sollte Open Source und Open Weights deshalb getrennt führen.

Welche Open-Source-KI-Plattformen gibt es?

Hier liegt die eigentliche Verwirrung. Übersichten zum Thema mischen vier Ebenen. Jede erfüllt eine eigene Aufgabe, und im Unternehmen verantwortet sie jemand anderer. Was als eine Plattform daherkommt, ist meist ein Stapel aus vier.

Ebene Beispiele Aufgabe Wer entscheidet
Frameworks und Bibliotheken TensorFlow, PyTorch, JAX, scikit-learn, MLflow Modelle trainieren, anpassen, überwachen Entwicklung, Data Science
Modelle und Gewichte Mistral, Llama, Qwen, DeepSeek, Gemma die Sprachfähigkeit selbst Fachbereich mit IT
Laufzeit und Inferenz llama.cpp, vLLM, Ollama LLM auf vorhandener Infrastruktur ausführen IT-Betrieb
Oberflächen und Anwendungen Open WebUI, Dify, Hugging Face Zugang schaffen, Firmenwissen anbinden IT mit Fachbereich

Die Trennung klärt, wer im Haus entscheidet. Ein Modellwechsel ist eine Fachentscheidung und in wenigen Tagen erledigt. Ein Wechsel der Laufzeitumgebung betrifft die Infrastruktur und zieht Tests nach sich. Sie schützt außerdem vor Abhängigkeiten: Wer alle vier Ebenen als Paket von einer Plattform bezieht, hat dieselbe Bindung wie bei einem Clouddienst, nur mit mehr Aufwand.

Welche KI-Modelle sind Open Source?

Der Markt bewegt sich schnell, die Lizenzen bewegen sich langsam. Die Übersicht gibt den Stand vom September 2026 wieder.

Modellfamilie Anbieter Lizenz der offenen Modelle Nach OSI-Maßstab offen? Worauf Sie achten sollten
DeepSeek DeepSeek, China MIT ja frühe Versionen liefen unter eigener Lizenz mit Nutzungsverboten
Phi Microsoft, USA MIT ja die Hinweise zu verantwortlichem Einsatz sind Empfehlung, keine Auflage
OLMo Allen Institute, USA Apache 2.0, Trainingsdaten unter ODC-BY ja einzige Familie mit offen abrufbaren Trainingsdaten
Whisper OpenAI, USA MIT ja Lizenzangaben auf Hugging Face widersprechen sich zwischen Varianten
gpt-oss OpenAI, USA Apache 2.0 ja
Mistral Mistral AI, Frankreich gemischt, Apache 2.0 bei Small, Large und Ministral teilweise Medium, Codestral und die OCR-Reihe laufen anders
Qwen Alibaba, China gemischt, Apache 2.0 bei mehreren Modellen teilweise die größten Modelle haben eigene Lizenzen mit Namensnennungspflicht
GLM Z.ai, China MIT bis Version 5.2, danach eigene Lizenz teilweise die Eigenlizenz zielt auf sehr große Plattformbetreiber
Gemma Google, USA eigene Bedingungen bis Version 3, Apache 2.0 ab Version 4 teilweise ältere Versionen mit Nutzungsverboten und Zugangssperre
Llama Meta, USA Llama 4 Community License nein Namenspflicht, MAU-Schwelle, EU-Ausschluss bei multimodalen Modellen

Die Spalte ganz rechts trägt den wichtigsten Befund: Die Lizenz gehört zum einzelnen Modell, nicht zur Familie. Mistral vergibt Apache 2.0 für Small und Large, hält Codestral und die OCR-Modelle aber geschlossen. Qwen nutzt drei verschiedene Lizenzen nebeneinander. Gemma war bis Version 3 eine Eigenlizenz mit Nutzungsverboten und ist seit Version 4 Apache 2.0. GLM lief bis 5.2 unter MIT und hat danach gewechselt. Wer eine Familie pauschal freigibt, gibt früher oder später etwas frei, das nicht freigegeben war.

Ein zweiter Punkt betrifft die Nachvollziehbarkeit. Nur OLMo vom Allen Institute veröffentlicht auch die Trainingsdaten, abrufbar als Dolma-Datensätze unter ODC-BY. Wenn Sie gegenüber einer Revision oder einem Auditor belegen müssen, womit ein Modell gelernt hat, bleibt praktisch nur diese Familie.

Als Filter taugt die Herkunft der Modelle dagegen kaum. Die saubersten Lizenzen verteilen sich quer über die Länder: MIT bei DeepSeek aus China und bei Phi aus den USA, Apache 2.0 bei OLMo aus den USA und bei Teilen von Mistral aus Frankreich. Die restriktivste Lizenz in dieser Übersicht kommt aus den USA. Wer chinesische Modelle ausschließen will, braucht dafür Argumente aus Lieferkette und Governance. Die Lizenzqualität liefert sie nicht.

Was ist die beste Open-Source-KI für Unternehmen?

Es gibt sie nicht. Die Frage führt in die Irre, weil die Anforderungen zu weit auseinanderliegen. Nützlicher sind vier Kriterien.

Das erste Kriterium ist die deutsche Sprachqualität. Benchmarks messen fast immer Englisch. Ein Modell, das in englischen Tests vorn liegt, kann im Deutschen umständlich formulieren, Fachbegriffe falsch beugen oder ins Englische kippen. Testen Sie deshalb mit eigenen Texten aus dem Arbeitsalltag.

Zweitens die Lizenz. Prüfen Sie vor dem Test, ob sie Ihren geplanten Einsatz deckt. Ein Modell wieder auszubauen, kostet erheblich mehr als die Prüfung vorher.

Der Speicherbedarf kommt als drittes dazu. Er bestimmt die Hardware und damit den größten Kostenblock.

Bleibt der Pflegezustand des Projekts. Ein Modell ohne aktive Weiterentwicklung wird zum Problem, sobald eine Sicherheitslücke auftaucht oder ein Format sich ändert.

Anwendungsfall Übliche Modellgröße Speicherbedarf, grob
Texte zusammenfassen, Dokumente durchsuchen 7 bis 14 Milliarden Parameter ab etwa 8 GB
Firmenwissen per RAG beantworten 14 bis 32 Milliarden ab etwa 24 GB
Code schreiben und prüfen 14 bis 32 Milliarden ab etwa 24 GB
Spracherkennung, Übersetzung Spezialmodelle wenige GB
Bilderkennung auf Geräten unter 100 Millionen wenige GB

Für viele Aufgaben reicht ein kleines Modell. Eine Bilderkennung kommt mit rund 70 Millionen Parametern aus und braucht keine 70 Milliarden. Wer immer zum größten verfügbaren Modell greift, zahlt für Hardware und Strom, ohne ein besseres Ergebnis zu bekommen.

Was sagt der EU AI Act zu Open-Source-KI?

Die Open-Source-Ausnahme der KI-Verordnung richtet sich an den Anbieter des Modells. Wer Mistral im eigenen Haus betreibt, ist Betreiber und fällt nicht darunter. Diese Zuordnung geht in vielen Übersichten verloren.

Die Verordnung kennt zwei getrennte Ausnahmen, die häufig verwechselt werden. Artikel 2 Absatz 12 nimmt quelloffene KI-Systeme vom Anwendungsbereich aus. Das gilt jedoch nicht, wenn das System als Hochrisiko-System in Verkehr kommt oder unter die verbotenen Praktiken nach Artikel 5 oder die Transparenzpflichten nach Artikel 50 fällt. Artikel 53 Absatz 2 regelt etwas anderes, nämlich die Pflichten der Anbieter von Modellen mit allgemeinem Verwendungszweck. Für Unternehmen zählt meist die zweite Regel, weil die großen Sprachmodelle darunter fallen.

Wovon befreit die Ausnahme wirklich?

Artikel 53 Absatz 1 legt vier Pflichten für Anbieter solcher Modelle fest:

  • a) eine technische Dokumentation des Modells führen
  • b) nachgelagerten Anbietern die Informationen geben, die diese für ihre eigene Compliance brauchen
  • c) eine Strategie zur Einhaltung des Urheberrechts vorhalten
  • d) eine ausführliche Zusammenfassung der Trainingsinhalte veröffentlichen

Absatz 2 befreit Anbieter offener Modelle von den ersten beiden Punkten, also von Buchstabe a und b. Dafür müssen Lizenz, Parameter und Architektur öffentlich zugänglich sein. Die Urheberrechtsstrategie und die Zusammenfassung der Trainingsinhalte bleiben bestehen. Viele Darstellungen im Netz verkürzen das und behaupten eine umfassende Befreiung. Für Sie hat die genaue Lesart einen praktischen Wert: Sie dürfen bei jedem offenen Modell nach der Zusammenfassung der Trainingsinhalte fragen, auch wenn der Anbieter sich auf die Ausnahme beruft.

Die Ausnahme greift außerdem gar nicht, sobald ein Modell als solches mit systemischem Risiko gilt. Die Schwelle liegt nach Artikel 51 Absatz 2 bei mehr als 10 hoch 25 Gleitkommaoperationen für das Training. Oberhalb davon treffen den Anbieter alle Pflichten, unabhängig von der Lizenz.

Die Erwägungsgründe der Verordnung ziehen eine weitere Grenze. Sobald ein Anbieter eine offene Komponente gegen Entgelt abgibt oder anders zu Geld macht, verliert er die Privilegierung. Ein Modell einfach auf GitHub oder Hugging Face bereitzustellen, zählt dabei nicht als Monetarisierung.

Welche Pflichten treffen Sie als Anwender?

Über Ihre Pflichten entscheidet der Einsatzzweck, und die Lizenz spielt dabei keine Rolle. Ein Chatbot für die interne Recherche ist etwas anderes als ein System, das über Bewerbungen mitentscheidet. Der zweite Fall fällt in den Hochrisikobereich. Dann müssen Sie dokumentieren, protokollieren und einen Menschen die Entscheidungen prüfen lassen.

Die Pflicht zur KI-Kompetenz gilt seit Februar 2025 und trifft jeden, der KI im Unternehmen einsetzt. Ihre Mitarbeiter müssen verstehen, was das System leistet und wo es irrt. Ein Managementsystem nach ISO/IEC 42001 bildet diese Anforderungen ab und lässt sich zertifizieren.

Die Pflichten für Modelle mit allgemeinem Verwendungszweck gelten seit dem 2. August 2025. Die zugehörigen Geldbußen nach Artikel 101 greifen erst seit dem 2. August 2026. Beides trifft in erster Linie die Anbieter. Sie merken es dort, wo Sie Nachweise über ein eingesetztes Modell brauchen und der Anbieter sie liefern muss.

Was hat der Digital Omnibus verschoben?

Am 27. Juli 2026 ist die Verordnung (EU) 2026/1744 in Kraft getreten, bekannt als Digital Omnibus. Sie verschiebt die Anforderungen an Hochrisiko-Systeme nach hinten. Die übrigen Fristen bleiben, wo sie waren.

Stichtag Was gilt Wen es trifft
2. Februar 2025 verbotene Praktiken nach Artikel 5, Pflicht zur KI-Kompetenz nach Artikel 4 alle
2. August 2025 Pflichten für Modelle mit allgemeinem Verwendungszweck, Artikel 53 Modellanbieter
2. August 2026 Geldbußen nach Artikel 101 Modellanbieter
2. Dezember 2026 zwei später eingefügte Verbotstatbestände alle
2. Dezember 2027 Hochrisiko-Anforderungen für die Anwendungsfälle aus Anhang III, verschoben vom August 2026 Betreiber und Anbieter
2. August 2028 Hochrisiko-Anforderungen für regulierte Produkte nach Anhang I Betreiber und Anbieter

Der Aufschub bei den Hochrisiko-Pflichten verschafft Zeit für die Vorbereitung. Er hebt die Pflichten nicht auf.

Wie sieht der Betrieb in der Praxis aus?

Wer ein offenes Modell selbst betreibt, tauscht laufende Tokenkosten gegen eigene Verantwortung. Das Modell kostet nichts. Der Betrieb kostet Hardware, Strom, Administration und die Pflege aller Komponenten, aus denen der Stack besteht.

Die SEQIS Group betreibt lokale Sprachmodelle seit Herbst 2023 im eigenen Haus. Aus dieser Erfahrung ist der razzfazz.ai Stack entstanden, den inzwischen auch Kunden einsetzen. Von den ersten Versuchen bis zur fertigen Integration vergingen rund zwei Jahre.

Welche Modelle laufen im Alltag?

Die Auswahl läuft nicht über die Modellfamilie, sondern über das Format. Im Betrieb sind ausschließlich Modelle im GGUF-Format, wie sie auf Hugging Face veröffentlicht werden. Ausgeführt werden sie über llama.cpp. Damit gilt eine einfache Regel: Was llama.cpp unterstützt, läuft — und das ist der weit überwiegende Teil des offenen Modellfelds. Eine Liste der eingesetzten Modelle wäre lang und nach drei Monaten falsch.

Drei Modelltypen laufen parallel, alle als GGUF. Die Chat- und Instruktionsmodelle erledigen die Textarbeit; wo das Modell es mitbringt, lesen sie auch Bilder und Videos. Dazu kommen Embedding-Modelle, die Dokumente in Vektoren übersetzen, und Reranking-Modelle, die die Treffer einer Suche nach Relevanz sortieren. Ohne die letzten beiden funktioniert keine brauchbare RAG-Anbindung. Bildgenerierung ist bislang bewusst nicht Teil des Stacks.

Die Parametergröße richtet sich nach der Hardware, nicht nach dem Ehrgeiz. Auf 96 GB Unified Memory laufen Modelle bis rund 120 Milliarden Parameter bei Q8-Quantisierung. Die Quantisierung ist dabei der eigentliche Hebel: Sie verkleinert die Gewichte und senkt den Speicherbedarf um ein Vielfaches, zulasten von etwas Genauigkeit. Für die meisten Aufgaben ist dieser Tausch gut investiert.

Aussortiert wurden Modelle bisher weniger wegen ihrer Qualität als wegen ihres Zeitpunkts. Bringt ein Anbieter eine neue Modellarchitektur heraus, dauert es, bis llama.cpp sie unterstützt im Regelfall ein paar Wochen. Wer den Stack plant, sollte diesen Versatz einkalkulieren statt auf Ankündigungen zu terminieren.

Das Management der Modelle, die Verwaltung der Workeragents, das Usagemonitoring aber auch das Loadbalancing übernimmt der rzfz.ai LLM Manager als zentrale Komponente des Stacks. Der LLM Manager erlaubt transparente Skalierung durch ein Master/Workerkonzept, bei dem zusätzliche Inferenzworker einfach hinzugefügt werden können und damit die Kapazität für parallele Requests linear ansteigt.

Die Administratoren können weitere Modelle ausprobieren, der darunterliegende Stack bleibt kuratiert. Er besteht aus Open WebUI als Oberfläche, einer RAG-Anbindung für Firmendokumente und einer Websuche, die Anfragen neutralisiert, bevor sie das Netzwerk verlassen. Eine Frage nach dem Vermögensstand einer Firma geht dann als allgemeine Frage nach dieser Firma hinaus. Die eigentliche Auswertung passiert lokal.

Was funktioniert gut?

Über alle Fälle hinweg ist das Muster dasselbe: Die KI liefert die Vorarbeit, ein Expert-in-the-Loop (EitL) entscheidet. Vier Beispiele aus dem eigenen Betrieb.

Maskenmigration.

Hunderte Eingabemasken eines Altsystems mussten in eine neue Oberfläche überführt werden. Vorher: Bereits einiges an Automation, aber noch viel Handarbeit, Maske für Maske, über Monate. Nachher: Das Modell erzeugt den Entwurf, ein Mensch prüft und korrigiert. Der Aufwand sank um rund 75 Prozent. Dieser Fall war der Auslöser für den gesamten Stack — und er hätte in der Cloud nie stattgefunden, weil die Daten das Haus nicht verlassen durften.

Testdesign aus einer Anforderung.

Ein Formular mit sechs Feldern ergibt in allen Varianten mehrere hundert mögliche Kombinationen. Vorher: Ein Tester schätzt erfahrungsbasiert ab und schreibt ein paar Testfälle. Nachher: Ein Statuswechsel im Ticket startet einen Ablauf, an dessen Ende ein überschaubarer Satz Testfälle steht, der den Raum abdeckt. Entscheidend ist dabei nicht die Zahl, sondern dass die Methodenwahl schriftlich begründet dabeisteht und der Ablauf selbst benennt, was er nicht abdeckt. Genau dort setzt die TesterIn an und ergänzt die Grenzfälle. Ein Ergebnis wird erst dadurch zu einem prüfbaren Ergebnis.

Testcode für Altsysteme.

Vorher: Gewachsener Code mit niedriger Testabdeckung, den niemand anfassen will, weil jede Änderung eine Wette ist. Nachher: Ein Agent sucht sich anhand der Änderungshistorie die riskanteste Stelle, schreibt Tests in einer Sandbox und reicht sie als Pull Request ein — nur Testcode, keine Produktionsdatei. Ein zweiter Agent reviewt. Zusammengeführt wird trotzdem nichts ohne Freigabe durch einen Menschen.

Firmenwissen durchsuchen.

Vorher: Wer eine Preisliste, eine Projektdokumentation oder einen alten Angebotstext suchte, fragte eine Kollegin oder durchforstete Ablagen und das Web. Nachher: eine Frage in natürlicher Sprache, eine Antwort mit Quellenangabe auf das Dokument.

Der Nutzen entsteht dort, wo Firmenwissen ins Spiel kommt. Große Modelle haben öffentlich verfügbare Texte längst gelesen. Was ihnen fehlt, sind interne Preislisten, Projektdokumentation und Wissensdatenbanken. Diese Daten lassen sich einfach lokal anbinden, ohne dass sie das Haus verlassen. Und auch Cloud-Modelle müssten um dieses interne Wissen ergänzt werden.

Die Frage, die uns dabei am häufigsten gestellt wird, lautet: Kann man KI-generierten Ergebnissen blind vertrauen? Nein, und das ist auch nicht das Ziel. Man prüft sie. Prüfen ist billiger als Schreiben.

Wo liegen die Grenzen?

Kleinere lokale Modelle erreichen die Qualität großer Cloud-Modelle nicht. Wer die beste verfügbare Textqualität braucht, bekommt sie im eigenen Haus nicht. Der Vorteil liegt woanders, nämlich im Durchsuchen, Zusammenfassen und Vergleichen sensibler Unterlagen ohne Clouddienst dazwischen. Und natürlich der Schutz von IP, Stabilität und Daten und Betriebs-Souveränität.

Dazu eine Korrektur an uns selbst: Wir sind mit der Annahme gestartet, größer sei besser. In Wahrheit schlägt das Modell, das in den vorhandenen Speicher passt und gut Deutsch kann, das theoretisch bessere, das nicht hineinpasst. Und weil ein Modellwechsel eine Konfigurationsänderung ist, ist diese Entscheidung jederzeit umkehrbar.

Die härteren Grenzen sind allerdings keine technischen. Vier Erfahrungen aus dem Eigenbetrieb.

Manchmal geht es mit KI einfach nicht — und das muss man merken dürfen.

Setzen Sie für jeden Versuch eine Zeitschranke, bevor Sie anfangen, und halten Sie sich daran. Die Versuchung, nach drei investierten Wochen die vierte dranzuhängen, ist groß und trotzdem ein Denkfehler: Die drei Wochen sind weg, gleich wie Sie weiter entscheiden. Was zählt, ist das Ziel, nicht der eingeschlagene Weg. Ein abgebrochener Versuch ist kein gescheitertes Projekt, solange das Ziel auf einem anderen Weg ankommt. Gescheitert ist erst, wer den Weg wichtiger nimmt als das Ziel.

Ein besserer Prompt löst es nicht.

Der verbreitetste Irrtum ist, KI sei ein Chatfenster, in das man nur gut genug formulieren muss. Ohne Domänenwissen prüft das Modell lediglich, dass eine Methode eine Zahl zurückgibt — und nicht, dass sie Ihre Geschäftsregel einhält. Brauchbare Ergebnisse brauchen vier Dinge: ein geeignetes Modell, den passenden Kontext, also die Begriffe, Dokumente und Regeln Ihres Hauses; einen wiederholbaren Ablauf statt einer einmaligen Eingabe; und eine definierte Stelle, an der eine Fachperson prüft und entscheidet — Expert-in-the-Loop, kurz EitL. Nicht irgendjemand, der abnickt, sondern jemand mit dem Fachwissen, den Fehler auch zu erkennen. Die Reihenfolge der Wirksamkeit hat uns überrascht: Kontext schlägt Prompt, Prompt schlägt Modell. Wer diese Möglichkeiten des eigenen Stacks nicht ausschöpft, betreibt eine Infrastruktur als Chatfenster.

Das Problem ist nicht die Halluzination, sondern die plausible Unvollständigkeit.

Eine erfundene Quellenangabe fällt auf. Ein Ergebnis, das nur vier von sechs notwendigen Feldern berücksichtigt, fällt niemandem auf — es sieht vollständig aus. Daraus folgt die wichtigste Regel für den Einsatz: Legen Sie vor dem ersten Versuch fest, woran Sie erkennen, dass er sich gelohnt hat. Sonst wird die Menge zur Kennzahl, und das ist die falsche. Zum Beispiel sind 100 generierte Testfälle, die niemand durchsieht, kein Fortschritt gegenüber 10, die jemand verantwortet — sie verlagern die Arbeit ans Ende der Kette, wo sie teurer wird. Die Obergrenze ist der Durchsatz Ihrer Fachleute, nicht der des Modells. Dieselbe Logik gilt für die Ergebnisse selbst: Ein System, das alles grün macht, ist wertlos. Eines, das Nein sagen kann, ist ein Werkzeug.

Der Zeitfresser war nicht die Technik.

Was länger gedauert hat als geplant, war nicht das Aufsetzen der Modelle, sondern die Datenlage. Eine Wissensanbindung ist nur so gut wie die Ablage, aus der sie liest. Doppelte Dokumentstände, veraltete Preislisten und Dateien ohne erkennbare Struktur liefern verlässlich schlechte Antworten — und zwar mit derselben Souveränität wie gute. Die Arbeit an Ordnung und Zuständigkeit für Dokumente hat bei uns mehr Zeit gekostet als der gesamte technische Aufbau. Wer lokale KI plant, sollte diesen Posten nicht unter „Vorbereitung“ verbuchen, sondern als eigenes Arbeitspaket führen.

Am Ende steht eine banale Einsicht, die im Alltag trotzdem am meisten Wirkung hat: Das ist ein Werkzeug. Es wird von Menschen beherrscht, nicht umgekehrt. Die Häuser, in denen lokale KI funktioniert, sind nicht die mit der größten Box, sondern die, in denen jemand die Verantwortung dafür übernommen hat, dass die Ergebnisse stimmen.

Wie viel Arbeit macht der Betrieb?

Ein solcher Stack besteht aus rund 50 Open-Source-Projekten. Jemand muss sie laufend im Blick behalten. Sicherheitsmeldungen treffen unregelmäßig ein, und wer zu lange wartet, schleppt eine bekannte Lücke mit sich herum. Wer selbst betreibt, übernimmt diese Aufgabe. Wer ein fertiges System kauft, gibt sie ab.

Im eingeschwungenen Betrieb rechnen wir im eigenen Haus mit rund vier bis acht Personenstunden pro Monat: Sicherheitsmeldungen sichten, Aktualisierungen einspielen, Nutzerverwaltung, gelegentlich ein Modell tauschen. Dazu kommen 8-16h für ein größeres Release oder eine neue Anbindung. Der Aufwand ist nicht gleichmäßig verteilt — eine kritische Schwachstelle in einer der Komponenten kann einen Tag kosten, und sie kündigt sich nicht an.

Beim Rhythmus unterscheiden wir Komponenten und Modelle. Für den Stack sind mindestens vier Releases pro Jahr zugesagt; tatsächlich liefern wir derzeit monatlich, weil sich das Open-Source-Umfeld schneller bewegt als jeder Release-Kalender. Sicherheitsrelevante Aktualisierungen laufen unabhängig davon, sobald sie vorliegen. Modelle dagegen tauschen wir anlassbezogen, nicht nach Plan: wenn ein neues Modell in unseren eigenen Tests spürbar besser abschneidet, nicht weil es erschienen ist.

Für Umgebungen ohne Internetzugang gibt es das Offline-Update über einen kontrollierten Weg. Das ist kein Randfall — in Produktion, Behörden und kritischer Infrastruktur ist es der Normalfall.

Bei der Governance ändert der lokale Betrieb wenig. Rollen, Zugriffsrechte und Schulungen bleiben Aufgabe des Unternehmens, egal wo das Modell läuft. Bei SEQIS arbeiten nach ISO/IEC 42001 zertifizierte KI-Managementsystem-Auditor:innen; wir begleiten Kunden z.B. beim Aufbau eines eigenen KI-Managementsystems.

„Die Frage, die uns Kunden stellen, ist nie ‚läuft das Modell‘. Sie lautet: Wer darf damit was, und kann ich das im Nachhinein belegen. Dass die KI im eigenen Haus steht, schafft viel Klarheit zur Frage wer was grundsätzlich darf. Zur vollständigen Antwort gehören dann Konzepte zu Rollen & Berechtigungsvergaben, Protokollierung von Änderungen und Abfragen — hier hilft der Stack, aber die Konzeption nimmt einem kein Server ab.“ — Alexander Weichselberger, Managing Partner, SEQIS Group

Wie die Box aufgebaut ist, welche Betriebsarten es gibt und was sie kostet, steht auf der Produktseite zu razzfazz.ai.

Häufige Fragen zur Open Source KI

Worauf kommt es bei der Entscheidung an?

Klären Sie zuerst, über welche der vier Ebenen Sie eigentlich sprechen. Die Lizenz prüfen Sie, bevor der erste Test läuft — und zwar für jedes einzelne Modell, nicht für die Familie. In die Kostenrechnung gehört neben der Hardware die Arbeitszeit für Aktualisierungen und Sicherheitsmeldungen. Und klären Sie zum Schluss, wo Ihre Daten landen. Diese Frage wiegt im Alltag schwerer als die Modellqualität.

Offene KI nutzen, ohne den ganzen Stack selbst zu bauen

Wer Modelle lokal betreiben will, muss nicht bei null anfangen. Der razzfazz.ai Stack bündelt Modell, Oberfläche, RAG, Websuche und den laufenden Betrieb in einem vorkonfigurierten System — für Unternehmen, die KI mit eigenen Daten nutzen wollen, ohne diese an einen externen KI-Dienst zu übertragen.

→ So funktioniert der razzfazz.ai Stack

Stand: 18. September 2026. Rechtliche Angaben geben den Stand zum Zeitpunkt der Veröffentlichung wieder und ersetzen keine Beratung im Einzelfall.

Weiterführende Artikel

KI & Automation
03 Aug. 2026 14 Min. Lesezeit

Vibe Coding: Definition, Tools & Risiken für Unternehmen

Dieser Ratgeber ordnet Vibe Coding sachlich ein: was der Begriff bedeutet, wie er funktioniert, welche Tools dahinterstecken und wo die Chancen und Grenzen liegen.

IT-Dock Redaktion Jetzt lesen →
KI & Automation
21 Juli 2026 15 Min. Lesezeit

KI-KoKI-Kompetenz | Pflicht & Umsetzung nach Art. 4 EU AI

KI-Kompetenz (AI Literacy) ► Seit 2.2.2025 Pflicht ✓ Durchsetzung ab August 2026 ✓ 4-Schritte-Fahrplan ✓ Nachweis & Dokumentation ✓ Jetzt umsetzen

Florian Ahlers Jetzt lesen →
KI & Automation
17 Juni 2026 19 Min. Lesezeit

RAG | Retrieval-Augmented Generation im Unternehmen

Was ist RAG und wie funktioniert es? So nutzen Unternehmen Retrieval-Augmented Generation für bessere KI-Antworten und produktive RAG-Chatbots.

Nils Hufnagel Jetzt lesen →
KI & Automation Gesponsert
09 Juni 2026 18 Min. Lesezeit

KI im Kundenservice | Proof of Concept als Einstieg

Wie lässt sich KI im Kundenservice sinnvoll testen? Der Artikel zeigt, warum ein Proof of Concept ein guter Einstieg sein kann, welche Vorteile er bietet und wie die Umsetzung abläuft.

Tillmann Strübig Jetzt lesen →
KI & Automation Gesponsert
09 Juni 2026 17 Min. Lesezeit

KI für Unternehmen | Vorteile, Einsatz & Einführung

Was bringt KI für Unternehmen und wie gelingt der Einstieg? Vorteile, Anwendungsfälle und Tipps zur erfolgreichen Einführung von künstlicher Intelligenz.

Tillmann Strübig Jetzt lesen →
KI & Automation Gesponsert
09 Juni 2026 15 Min. Lesezeit

NVIDIA KI | GPUs, Inferenz & Infrastruktur für Unternehmen

Warum ist NVIDIA für KI im Unternehmen so relevant? Der Beitrag zeigt, wie GPUs, Inferenz, Software und Infrastruktur produktive KI-Anwendungen ermöglichen.

Tillmann Strübig Jetzt lesen →
KI & Automation Gesponsert
09 Juni 2026 18 Min. Lesezeit

KI und Datenschutz | DSGVO-konform im Unternehmen nutzen

Wie lässt sich KI datenschutzkonform einsetzen? Der Artikel zeigt, was Unternehmen bei DSGVO, personenbezogenen Daten, Datenverarbeitung und KI-Tools beachten müssen.

Tillmann Strübig Jetzt lesen →
KI & Automation
20 Mai 2026 20 Min. Lesezeit

NPU | Neural Processing Unit: Nutzen, Vergleich & Kauf

Was eine Neural Processing Unit wirklich kann, ob du sie überhaupt brauchst und wie du prüfst, ob dein Gerät schon eine besitzt.

Hendrik Schrandt Jetzt lesen →
KI & Automation
19 Mai 2026 11 Min. Lesezeit

Gemma 4 | Lokal installieren auf MacBook mit LM Studio

Mit Gemma 4 schickt Google DeepMind die vierte Generation seiner offenen Modellfamilie ins Rennen — und zwar nicht in die Cloud, sondern auf deinen eigenen Rechner.

Hendrik Schrandt Jetzt lesen →
KI & Automation
15 Mai 2026 16 Min. Lesezeit

Workflow Automation mit n8n: Self-Hosted, Docker & AI Agents

Wie n8n, Docker, Self-Hosting und AI-Workflows moderne Workflow Management Systeme praktisch erweitern.

Nils Hufnagel Jetzt lesen →

Kommentare (0)

Noch keine Kommentare vorhanden.

Back to top