Startseite / KI
KI

Aleph Alpha Kolibri: Deutschlands KI setzt nicht auf größer, sondern auf Kontrolle

Aleph Alpha Kolibri: Deutschlands KI setzt nicht auf größer, sondern auf Kontrolle
← Alle Beiträge

Aleph Alpha meldet sich mit einem ungewöhnlichen Gegenentwurf zum Wettrennen um immer größere KI-Modelle zurück. Kolibri hat insgesamt 78,1 Milliarden Parameter. Pro verarbeitetem Token werden davon aber nur rund 3,46 Milliarden aktiviert.

Das neue Modell aus Heidelberg soll deshalb nicht mit GPT, Claude oder Gemini um den Titel des größten Universalmodells kämpfen. Aleph Alpha optimiert Kolibri stattdessen auf einen deutlich engeren Bereich: Deutsch und Englisch, lange Dokumente, lokale Infrastruktur, nachvollziehbare Antworten und Anwendungen in Behörden und Industrie.

Und genau das macht Kolibri interessanter als die reine Parameterzahl.

78 Milliarden Parameter – aber nur 3,46 Milliarden arbeiten gleichzeitig

Kolibri ist ein sogenanntes Mixture-of-Experts-Modell. Statt bei jedem Wort das komplette neuronale Netz zu benutzen, entscheidet ein Router, welche Teile des Modells für die aktuelle Aufgabe gebraucht werden.

In Kolibri stecken 384 solcher Experten pro Schicht. Für einen Token werden nur sechs davon aktiviert, zusätzlich gibt es einen gemeinsamen Experten.

Das Ergebnis klingt zunächst paradox: Das Modell besitzt 78,1 Milliarden Parameter, berechnet einen Token aber mit nur etwa 3,46 Milliarden davon.

Damit versucht Aleph Alpha zwei Dinge gleichzeitig zu erreichen: viel Modellkapazität und vergleichsweise geringe Rechenkosten während der Nutzung.

Einen Haken hat das Prinzip allerdings. Auch wenn nur ein kleiner Teil der Parameter aktiv arbeitet, müssen die gesamten Gewichte im GPU-Speicher liegen.

Kolibri benötigt in FP8 deshalb rund 78 GB Speicher. Aleph Alpha nennt als Mindestkonfiguration unter anderem zwei A100 mit jeweils 80 GB, zwei H100 oder einzelne H200-, B200- beziehungsweise B300-GPUs.

Das ist ein lokal betreibbares Modell – aber kein Modell für den durchschnittlichen Gaming-PC.

Der eigentliche Vorteil steckt im Deutschen

Viele große Sprachmodelle können ausgezeichnet Deutsch. Ihre Architektur und vor allem ihre Trainingsdaten sind trotzdem stark vom Englischen geprägt.

Aleph Alpha ist bei Kolibri einen anderen Weg gegangen. Rund ein Fünftel der Pretraining-Daten besteht aus deutschem Text. Das Modell besitzt außerdem einen speziell für Deutsch und Englisch entwickelten Tokenizer.

Das klingt nach einem technischen Detail, kann bei deutschen Texten aber einen erheblichen Unterschied machen.

Sprachmodelle lesen keine Wörter, sondern Tokens. Gerade lange deutsche zusammengesetzte Wörter werden von englisch dominierten Tokenizern häufig in zahlreiche kleine Bestandteile zerlegt.

Kolibri versucht stattdessen, die Struktur solcher Wörter besser zu erkennen. Aleph Alpha nennt beispielsweise Begriffe wie „Bundessozialgerichtes“ oder „Protokolldaten“, die der eigene Tokenizer in deutlich sinnvollere Einheiten zerlegt.

Weniger Tokens bedeuten weniger Rechenarbeit und gleichzeitig mehr Text innerhalb desselben Kontextfensters.

Für ein Modell, das Akten, Verträge, technische Dokumentationen oder Verwaltungsvorschriften verarbeiten soll, ist das kein kosmetischer Vorteil.

Eine Million Token Kontext – mit Einschränkung

Kolibri unterstützt laut Aleph Alpha Kontextfenster von bis zu 1.048.576 Tokens.

Damit könnten theoretisch sehr große Mengen an Dokumenten gleichzeitig verarbeitet werden.

Ganz so einfach ist die Zahl allerdings nicht. Trainiert wurde Kolibri zunächst mit 16.384 Tokens, anschließend mit 65.536 und in einer Long-Context-Phase mit 262.144 Tokens.

Bis zu einer Million Tokens wurde die Architektur anschließend getestet und validiert. Für komplexe oder latenzkritische Anwendungen empfiehlt Aleph Alpha selbst weiterhin maximal 262.144 Tokens.

Interessant ist die Architektur dahinter. Von 50 Modellschichten arbeiten 40 nur mit einem lokalen Fenster von 512 Tokens. Lediglich jede fünfte Schicht betrachtet den vollständigen Kontext.

So verhindert Aleph Alpha, dass die Kosten bei langen Eingaben explodieren.

Kolibri soll lieber „Ich weiß es nicht“ sagen

Der vielleicht interessanteste Teil des Modells hat mit Größe überhaupt nichts zu tun.

Aleph Alpha hat Kolibri gezielt darauf trainiert, eine Antwort zu verweigern, wenn die bereitgestellten Dokumente keine ausreichenden Informationen enthalten.

Das Unternehmen nennt das zugrunde liegende Verfahren Merlin-Arthur.

Während des Trainings bekommt das Modell unter anderem Dokumente, aus denen die entscheidenden Belege entfernt wurden. Statt die fehlenden Informationen durch plausibel klingende Vermutungen zu ergänzen, soll Kolibri erkennen, dass eine belastbare Antwort nicht möglich ist.

Das klingt selbstverständlich. Bei Sprachmodellen ist es das nicht.

Gerade für RAG-Systeme in Unternehmen ist dieses Verhalten entscheidend. Eine KI, die eine interne Dokumentation durchsucht, soll nicht den wahrscheinlichsten Ersatz erfinden, wenn eine Information fehlt.

Sie soll sagen: Dazu finde ich keinen Beleg.

Die Benchmarks sehen stark aus – stammen aber von Aleph Alpha

Aleph Alpha veröffentlicht umfangreiche Vergleichswerte für Kolibri. Besonders bei Mathematik, deutschsprachigem Reasoning und einigen dokumentenbasierten Aufgaben schneidet das Modell gegenüber ähnlich großen beziehungsweise ähnlich sparsamen Modellen gut ab.

Beim AIME-2025-Benchmark erreicht Kolibri beispielsweise nach Angaben des Unternehmens 96,9 Punkte auf Englisch und 87,5 auf Deutsch.

Auch bei sehr langen Kontexten sieht das Modell interessant aus. Im RULER-Test erreicht die Basismodell-Version bei einer Million Tokens 63,2 Punkte. Qwen3.5 35B-A3B liegt in der von Aleph Alpha veröffentlichten Auswertung bei 57,5.

Diese Zahlen sollte man trotzdem richtig einordnen.

Die Vergleiche wurden von Aleph Alpha selbst durchgeführt. Das Unternehmen veröffentlicht zwar sein Evaluierungsverfahren und führt die Modelle nach eigenen Angaben unter vergleichbaren Bedingungen aus, unabhängige Tests müssen nun aber zeigen, wie gut Kolibri außerhalb dieser Umgebung tatsächlich ist.

Außerdem gewinnt Kolibri längst nicht überall.

Bei manchen kürzeren Long-Context-Tests liegt Qwen deutlich davor. Bei Multi-Turn-Tool-Calling und Coding gibt es ebenfalls stärkere Modelle.

Kolibri ist kein Modell, das jeden Benchmark gewinnen soll.

„Souverän“ bedeutet nicht vollständig europäisch

Aleph Alpha bezeichnet Kolibri als souveränes Modell.

Dafür gibt es gute Argumente. Entwicklung und Training fanden nach Angaben des Unternehmens in Deutschland und Finnland statt. Die Gewichte können heruntergeladen und auf eigener Infrastruktur betrieben werden. Eine Organisation muss ihre internen Dokumente deshalb nicht an einen amerikanischen oder chinesischen KI-Anbieter senden.

Die Modellgewichte und Konfigurationsdateien stehen unter Apache 2.0.

Vollständig Open Source im klassischen Sinn ist Kolibri damit allerdings nicht. Aleph Alpha stellt beispielsweise seinen Trainingscode und verschiedene Trainingsmethoden nicht unter diese Lizenz.

Und souverän bedeutet auch nicht, dass bei der Entwicklung ausschließlich europäische Technologie verwendet wurde.

Die Model Card nennt unter anderem Googles Gemma für synthetische englische Trainingsdaten, Mistral-NeMo für deutsche Umformulierungen und Qwen3-32B für Bewertungen zur Datenqualität.

Das schmälert die technische Eigenleistung nicht. Es zeigt aber, dass technologische Souveränität heute eher Kontrolle über das Endprodukt und dessen Betrieb bedeutet als eine komplett abgeschottete europäische Lieferkette.

20 Billionen Tokens reichen nicht

Auch beim Training wird sichtbar, welcher Aufwand inzwischen selbst hinter einem vergleichsweise effizienten Modell steckt.

Das eigentliche Pretraining umfasste rund 20 Billionen Tokens. Hinzu kamen etwa 3,44 Billionen Tokens Mid-Training sowie rund 200 Milliarden Tokens für die Erweiterung des Kontextfensters.

Dafür verwendete Aleph Alpha 768 NVIDIA-B200-GPUs.

Das Unternehmen beschreibt außerdem, dass zunächst mehr als 200 Billionen rohe Tokens durch die Datenpipeline liefen, bevor Filterung, Deduplizierung und Auswahl daraus den eigentlichen Trainingsbestand machten.

Europäische KI-Souveränität bedeutet also weiterhin: europäisches Modell, europäische Kontrolle – aber amerikanische GPUs.

Kolibri ist kein ChatGPT-Ersatz

Wer Kolibri als deutschen Konkurrenten zu ChatGPT betrachtet, verpasst deshalb den eigentlich interessanten Teil der Veröffentlichung.

Für allgemeine Wissensfragen gibt es leistungsfähigere Modelle. Für Coding-Agenten gibt es bessere Kandidaten. Und mit rund 78 GB benötigtem GPU-Speicher wird Kolibri auch nicht plötzlich auf jedem Büro-PC laufen.

Sein sinnvollster Einsatz liegt dort, wo andere Anforderungen wichtiger sind als maximale Universalität.

Eine Behörde könnte Aktenbestände auf eigener Infrastruktur durchsuchen. Ein Maschinenbauer könnte technische Dokumentationen und Servicedaten anbinden. Ein Unternehmen könnte ein RAG-System aufbauen, ohne vertrauliche Daten an eine externe API zu senden.

Genau dort treffen mehrere Eigenschaften von Kolibri aufeinander: gutes Deutsch, große Kontextfenster, kontrollierbares Reasoning, lokale Installation und die Fähigkeit, eine Antwort bewusst abzulehnen.

Europa braucht nicht zwingend das größte Modell

Kolibri löst Europas KI-Abhängigkeit nicht.

Die Hardware stammt weiterhin von NVIDIA. Teile der Datenaufbereitung nutzen Modelle anderer Anbieter. Und gegenüber den größten amerikanischen und chinesischen Modellen fehlt Aleph Alpha weiterhin massiv Rechenleistung.

Aber vielleicht ist genau die Vorstellung falsch, Europa müsse OpenAI, Google oder Anthropic einfach mit einem noch größeren Universalmodell kopieren.

Kolibri verfolgt einen anderen Ansatz.

Nicht das Modell mit dem meisten Weltwissen. Nicht das beste Coding-Modell. Nicht die KI für jede Sprache und jeden Anwender.

Sondern ein Modell, das deutsche Dokumente effizient verarbeitet, auf Infrastruktur des Kunden läuft und im Zweifel lieber keine Antwort gibt als eine erfundene.

Für eine Behörde oder einen Industriebetrieb könnte genau das wertvoller sein als der nächste Platz eins in einem allgemeinen Chatbot-Benchmark.

J

Über den Autor

Jens Könnig

Jens analysiert seit Jahren digitale Märkte, Preisbewegungen und Plattform-Strategien. Als Betreiber mehrerer datengetriebener Systeme wertet er täglich große Mengen an Produkt- und Trenddaten aus. Sein Fokus liegt auf Einordnung statt Hype: Was bedeutet eine Entwicklung wirklich für Nutzer, Preise und Märkte?

Alle Artikel von Jens Könnig →