„Souveräne KI“ ist in Deutschland gerade das Wort, mit dem sich jeder Anbieter schmückt. Diese Woche liegen zwei Angebote nebeneinander, an denen man gut sehen kann, wie unterschiedlich der Begriff gefüllt wird. Auf der einen Seite Aleph Alpha mit Kolibri: ein Modell, dessen Gewichte ihr herunterladen und auf eigener Hardware betreiben könnt. Auf der anderen Seite „OpenAI for Germany“: OpenAI-Modelle, betrieben von SAPs Tochter Delos Cloud auf Microsoft-Azure-Technologie in deutschen Rechenzentren.
Der Bund hat sich nicht festgelegt. Auf seiner KI-Plattform KIPITZ sind mehrere Wege möglich. Für Behörden ist das eine Architekturentscheidung mit langem Vorlauf. Für einen Mittelständler mit 30 Mitarbeitern stellt sich eine viel einfachere Frage: Was davon kann ich nächsten Monat tatsächlich einsetzen, und was bringt es mir?
Kolibri: Was Aleph Alpha veröffentlicht hat
Kolibri ist am 3. Oktober erschienen, als Open-Weight-Modell unter Apache-2.0-Lizenz auf Hugging Face. Technisch ist es ein Mixture-of-Experts-Modell: 78,1 Milliarden Parameter insgesamt, aber pro Token sind nur rund 3,46 Milliarden aktiv. Das Kontextfenster liegt bei etwa einer Million Tokens. Trainiert wurde es mit Schwerpunkt auf Deutsch und Englisch.
Aleph Alpha positioniert Kolibri klar für regulierte Umgebungen: öffentliche Verwaltung, Industrie, Luft- und Raumfahrt. Das Unternehmen hat dokumentiert, wie es mit Urheberrecht, Datenschutz und den Anforderungen des EU AI Act umgegangen ist. In den eigenen Benchmarks liegt Kolibri bei deutschsprachigen Aufgaben vor vergleichbaren offenen Modellen, etwa bei der deutschen Fassung von GPQA Diamond knapp vor Qwen 3.6. Das sind Herstellerzahlen. Wir würden sie ernst nehmen, aber nicht blind übernehmen.
Die Apache-2.0-Lizenz ist der eigentlich wichtige Punkt. Sie erlaubt kommerzielle Nutzung, Anpassung und Weitergabe ohne Rückfrage beim Hersteller. Wenn Aleph Alpha morgen seine Strategie ändert, aufgekauft wird oder die Preise für seinen eigenen Dienst anhebt, bleibt das Modell, das ihr heruntergeladen habt, eures. Das ist Souveränität im wörtlichen Sinn: Niemand kann es euch wegnehmen.
„OpenAI for Germany“: Was SAP und OpenAI anbieten
Angekündigt wurde der Dienst bereits im September 2025, der Start ist für 2026 geplant. Das Modell ist ein anderes: OpenAI liefert die Modelle, SAP betreibt sie über Delos Cloud, und Delos Cloud läuft auf Azure-Technologie von Microsoft. SAP baut dafür die Delos-Infrastruktur in Deutschland auf 4.000 GPUs aus. Die Souveränität entsteht hier durch Betreiber und Standort: deutsche Gesellschaft, deutsche Rechenzentren, Zusagen zu Datenschutz und Sicherheit nach deutschen Standards.
Der entscheidende Satz für unsere Leser steht in jeder Ankündigung: Zielgruppe ist der öffentliche Sektor. Verwaltungen, Behörden, Forschungseinrichtungen. Von einem Angebot für Unternehmen oder gar für KMU ist bisher nicht die Rede.
Das ist kein Detail. Ein Mittelständler, der heute liest, dass es „jetzt souveräne OpenAI-Modelle aus Deutschland“ gibt, und daraufhin seine Strategie danach ausrichtet, plant mit einem Produkt, das er nach aktuellem Stand nicht kaufen kann.
Zwei Bedeutungen von Souveränität
Legt man beide Angebote nebeneinander, sieht man zwei verschiedene Antworten auf die Frage, wovor Souveränität eigentlich schützen soll.
Kolibri schützt vor dem Anbieter. Die Gewichte gehören euch, der Betrieb liegt bei euch. Weder Aleph Alpha noch ein Cloud-Betreiber kann den Zugang sperren, die Konditionen ändern oder das Modell austauschen. Der Preis dafür: Ihr seid selbst für Hardware, Betrieb, Updates und Sicherheit verantwortlich.
„OpenAI for Germany“ schützt vor dem Standort. Die Daten bleiben in Deutschland, der Vertragspartner ist ein deutsches Unternehmen. Aber das Modell bleibt ein OpenAI-Modell, die Technologie darunter kommt von Microsoft, und welche Modellversion ihr wann bekommt, entscheiden andere. Wenn OpenAI eine Version abkündigt oder das Verhalten eines Modells ändert, betrifft euch das genauso wie jeden anderen Kunden.
Für uns ist der zweite Punkt der unterschätzte. In den letzten Monaten haben wir hier mehrfach beschrieben, wie Anbieter ohne Vorwarnung Modelle umleiten, Preise umstellen oder Nutzungsbedingungen ändern. Ein deutscher Betreiber ändert daran wenig, solange das Modell selbst von einem US-Anbieter kommt. Die DSGVO-Frage wird kleiner, das Vendor-Risiko bleibt.
Was Kolibri in der Praxis braucht
Hier wird es für KMU konkret, und hier liegt auch die größte Hürde. Im nativen FP8-Format braucht Kolibri rund 78 GB Speicher. Aleph Alpha nennt als Mindestausstattung zwei A100- oder H100-Karten mit je 80 GB oder eine einzelne H200. Das ist Rechenzentrumshardware im fünfstelligen Bereich, oder Cloud-GPUs, die man stundenweise mietet.
Interessanter für kleinere Setups sind die quantisierten Varianten, die die Community innerhalb weniger Tage gebaut hat. Eine 4-Bit-GGUF-Version liegt bei etwa 47,5 GB, eine 3-Bit-Variante bei knapp 34 GB. Für Apple Silicon gibt es MLX-Builds, die 4-Bit-Fassung braucht rund 44 GB. Damit passt Kolibri in 4 Bit auf einen Rechner mit 64 GB Arbeitsspeicher — also auf einen gut ausgestatteten Mac Studio oder eine Workstation, die viele Agenturen ohnehin schon haben.
Ein Haken bleibt nach aktuellen Berichten: Ollama, das für viele der einfachste Weg zu lokalen Modellen ist, kann Kolibri noch nicht laden. Wer jetzt testen will, muss über llama.cpp oder MLX gehen. Das ist für jemanden mit etwas Kommandozeilen-Erfahrung kein Problem, für die meisten Geschäftsführer aber eine echte Hürde.
Wir haben es intern genau so eingeordnet. Unsere Always-On-Agenten laufen auf einem Mac Studio mit 64 GB, dort nutzen wir lokal über Ollama ein kleineres Modell für Tool-Calling. Die FP8-Fassung von Kolibri passt nicht, die 4-Bit-Fassung würde gerade passen, ließe aber kaum Luft für alles andere, was auf dem Rechner läuft. Wir warten auf die Ollama-Unterstützung und testen dann gezielt an deutschen Texten aus unserem Alltag. Vorher eine Empfehlung auszusprechen, wäre unseriös.
Das MoE-Argument: Warum 3,46 Milliarden aktive Parameter zählen
Bei Mixture-of-Experts-Modellen werden die Gesamtparameter im Speicher gehalten, aber pro Token rechnet nur ein kleiner Teil. Das heißt: Der Speicherbedarf entspricht einem großen Modell, die Rechenlast eher einem kleinen. Auf einem Rechner, der genug Speicher hat, läuft Kolibri dadurch deutlich schneller, als die 78 Milliarden vermuten lassen.
Für typische KMU-Aufgaben ist das relevant. Wer interne Dokumente zusammenfassen, Angebote vorformulieren oder Kundenanfragen vorsortieren will, braucht kein Spitzenmodell, sondern ein solides Modell, das auf Deutsch sauber formuliert und schnell genug antwortet. Genau in dieser Klasse ist Kolibri interessant — vorausgesetzt, die Herstellerangaben zur deutschen Sprachqualität bestätigen sich im Alltag.
Das Kontextfenster von einer Million Tokens sollte man dagegen nicht überbewerten. Auf lokaler Hardware mit 64 GB wird der Speicher lange vor dieser Grenze knapp. Für die meisten Anwendungen in kleinen Unternehmen reichen ohnehin ein paar zehntausend Tokens.
Was wir KMU konkret raten
Plant nicht mit „OpenAI for Germany“. Solange das Angebot sich an den öffentlichen Sektor richtet, ist es für euch keine Option. Wenn ihr OpenAI-Modelle mit EU-Datenhaltung braucht, gibt es heute schon Wege über Azure-Regionen in der EU oder die Enterprise-Angebote mit Datenresidenz. Die sind nicht souveräner, aber verfügbar.
Behandelt Kolibri als Testkandidaten, nicht als Ersatz. Für einen produktiven Einsatz ist es zu früh: wenige Tage alt, eigene Benchmarks des Herstellers, noch keine Unterstützung im einfachsten Werkzeug. Für einen strukturierten Test an euren eigenen Daten ist es dagegen genau richtig. Wählt zwei, drei echte Aufgaben aus eurem Alltag, lasst sie von Kolibri und von eurem aktuellen Cloud-Modell bearbeiten, und vergleicht die Ergebnisse.
Baut die Architektur so, dass das Modell austauschbar ist. Das ist der eigentliche Hebel, und wir wiederholen ihn bewusst. Wenn eure Agenten und Workflows fest an einen Anbieter gebunden sind, nützt euch das beste offene Modell nichts, weil der Wechsel ein Projekt ist. Wenn ihr dagegen einen flexiblen Harness habt, ist Kolibri ein zusätzlicher Eintrag in der Konfiguration. Dann könnt ihr sensible Aufgaben lokal laufen lassen und den Rest in der Cloud.
Rechnet die Hardware ehrlich. Ein Rechner mit 64 GB, der Kolibri in 4 Bit trägt, kostet einmalig einen niedrigen vierstelligen Betrag. Dem stehen eure laufenden API-Kosten gegenüber, plus der Aufwand für Betrieb und Updates. Für ein Unternehmen, das monatlich nur ein paar Dutzend Euro an API-Gebühren hat, rechnet sich das nicht über die Kosten, sondern höchstens über die Datenschutz-Frage. Für ein Unternehmen mit vierstelligen Monatsbeträgen und vielen internen Dokumenten sieht die Rechnung anders aus.
Warum das trotzdem eine gute Nachricht ist
Lange war das Argument gegen europäische Modelle, dass sie qualitativ nicht mithalten. Ob Kolibri diese Lücke schließt, wird sich in den nächsten Wochen in unabhängigen Tests zeigen. Unabhängig davon verschiebt es die Lage: Es gibt jetzt ein deutschsprachig trainiertes, offen lizenziertes Modell, das auf Hardware läuft, die ein Mittelständler kaufen kann. Das war vor einem Jahr nicht der Fall.
Für Verhandlungen mit den großen Anbietern ist das ebenfalls nützlich. Wer eine realistische lokale Alternative für einen Teil seiner Aufgaben hat, ist bei der nächsten Preisänderung weniger erpressbar.
Hartes Fazit: „Souveräne KI“ heißt bei Kolibri, dass euch das Modell gehört. Bei „OpenAI for Germany“ heißt es, dass die Daten in Deutschland bleiben, während das Modell weiter OpenAI gehört — und dieses Angebot richtet sich derzeit ohnehin nur an Behörden. Für KMU ist die realistische Option deshalb Kolibri als Testkandidat in einer Architektur, in der das Modell austauschbar ist. Wer seinen Agenten-Stack heute noch an einen einzigen Anbieter gekettet hat, sollte das zuerst lösen. Das neue Modell kommt danach.
Lohnt sich ein lokales Modell für euch?
Im KI-Audit prüfen wir, welche eurer Aufgaben sich für ein lokales Modell wie Kolibri eignen, was die Hardware kostet und wie euer Stack aufgebaut sein muss, damit der Wechsel eine Konfigurationsänderung bleibt und kein Projekt wird.
Audit anfragen