Soofi S: Was Deutschlands offenes LLM im Betrieb taugt
Im Juli 2026 hat ein deutsches Konsortium unter Koordination des KI Bundesverbands sein erstes Sprachmodell veröffentlicht: Soofi S, trainiert auf der Industrial AI Cloud der Deutschen Telekom in München. Die Berichterstattung war einhellig positiv, und die Benchmarks geben das her. Für Entscheider im Mittelstand ist die interessantere Frage aber eine andere: Lässt sich damit heute schon arbeiten? Die Antwort fällt differenzierter aus, als die Schlagzeilen vermuten lassen.
Was das Modell technisch ist
Soofi S ist ein Mixture-of-Experts-Modell mit 31,6 Milliarden Parametern, von denen pro Token nur etwa 3,2 Milliarden aktiv sind. Das drückt den Rechenbedarf deutlich unter das, was ein klassisches Modell dieser Größe verlangen würde. Die Architektur kombiniert Mamba-2-Layer mit klassischen Attention-Layern, insgesamt 52 Layer, von denen nur sechs einen KV-Cache führen. Der Speicherbedarf bleibt dadurch auch bei langen Eingaben handhabbar. Als Basis diente Nvidias Nemotron-3-Nano-Architektur.
Alle folgenden Zahlen stammen aus dem Technical Report des Konsortiums und der Modellkarte auf Hugging Face. Das Training umfasste rund 27 Billionen Token in drei Phasen, mit einem Deutsch-Anteil von 7,2 Prozent in der ersten und 15,3 Prozent in der zweiten Phase. Die Quellen sind offengelegt: HPLT, German Commons, FinePDFs, FineWiki und ein lizenziertes Genios-Korpus mit 193 Millionen Zeitungsartikeln. Gerechnet wurde vom 24. März bis 13. Mai 2026 auf bis zu 512 Nvidia-B200-Karten, verteilt auf 64 DGX-Knoten, mit rund 253.000 GPU-Stunden.
Finanziert wird das Vorhaben vom Bundesministerium für Wirtschaft und Energie im Rahmen von IPCEI-CIS. Das ist derselbe europäische Souveränitätsrahmen, aus dem auch das Open Component Model stammt. Die Förderlogik ist in beiden Fällen dieselbe: offene Bausteine schaffen, die europäische Anbieter unabhängig von US-Plattformen kombinieren können.
Die Lizenzfrage: offen ist es noch nicht
Hier lohnt der Blick auf die Modellkarte statt auf die Pressemeldungen. Auf Hugging Face steht Soofi S unter einer Closed-Beta-Lizenz, der Zugang ist gated, und die Karte formuliert unmissverständlich: Dies sei ein Beta-Preview und ein Forschungsartefakt, ausdrücklich kein offenes Release. Die permissive Lizenz ohne Zugangsbeschränkung ist angekündigt, aber Stand Mitte August 2026 nicht in Kraft.
Praktisch bedeutet das: Das Modell lässt sich derzeit nicht einfach herunterladen und ausprobieren. Alle Varianten auf Hugging Face, auch die quantisierten GGUF- und FP8-Derivate, stehen unter manueller Freigabe, ein Abruf ohne Zugang endet mit HTTP 401. Und die Projektseite ist eindeutig: Die Beta läuft mit bereits ausgewählten Partnern, weitere Bewerbungen für die Testphase werden aktuell nicht angenommen. Wer das Modell heute evaluieren will, kann das also schlicht nicht.
Für die Bewertung macht das einen Unterschied. Ein Modell, dessen Nutzungsbedingungen sich noch ändern können, taugt nicht als Fundament für ein Produkt, das in zwei Jahren noch laufen soll. Wer die Unterscheidung zwischen offenen Gewichten und echter Open-Source-Lizenz schon einmal durchdacht hat, kennt das Muster aus unserem Artikel zu Open Weights und Open Source: Der Begriff “offen” wird im KI-Umfeld sehr großzügig verwendet, und die Details stehen selten in der Überschrift.
Fairerweise: Das Konsortium kommuniziert den Beta-Status transparent auf der Modellkarte. Verkürzt wird eher in der Berichterstattung. Und das Basismodell hat kein Safety-Tuning, was für ein Forschungsartefakt normal ist, aber vor jedem produktiven Einsatz eigenes Post-Training und eigene Leitplanken erfordert.
Wo die Benchmarks halten und wo nicht
Die guten Zahlen sind real. Unter den vollständig offenen Modellen erreicht Soofi S die besten Aggregatwerte für Deutsch und Englisch und liegt vor Olmo 3 32B und Apertus 70B, letzteres bei weniger als der Hälfte der Parameter. Das deutsche Aggregat liegt bei 85,3 Punkten, auf ARC-Challenge-DE stehen 92,3 Prozent, und bei den Code-Aggregaten für Deutsch und Englisch belegt Soofi S unter 16 offenen Basismodellen jeweils den ersten Platz. Für ein Modell mit 3,2 Milliarden aktiven Parametern sind das bemerkenswerte Werte. Gegenüber europäischen Souveränitätsmodellen wie Teuken-7B, EuroLLM oder Salamandra liegt es nach eigener Messung auf jedem deutschen Benchmark der Suite vorn oder gleichauf, oft mit 10 bis 30 Punkten Abstand.
Drei Einschränkungen gehören zur ehrlichen Einordnung. Erstens die Mathematik: Auf Minerva MATH-DE erreicht das Modell 56 Punkte, Qwen3.5 in vergleichbarer Größe kommt auf 76,5. Zweitens das Faktenwissen: Bei offenen Wissensfragen liegt Soofi S hinter dichteren Modellen, was bei 3,2 Milliarden aktiven Parametern strukturell zu erwarten ist. Drittens, und praktisch am wichtigsten, der lange Kontext.
Das Modell wirbt mit bis zu einer Million Token Kontextfenster. Der Report misst das mit RULER gegen das Nemotron-Basismodell und differenziert dabei sauber: Über alle 13 Teilaufgaben liegt Soofi S im Schnitt 6,8 Punkte zurück, ohne die Teilaufgabe Common Word Extraction schrumpft der Abstand auf 4,4 Punkte, was der Report selbst als weitgehend gleichauf bezeichnet. Genau bei dieser einen Teilaufgabe aber bricht das Modell jenseits von 32.000 Token ein, von 64 auf 3 Punkte. Für RAG-Szenarien ist das relevant, weil Extraktionsaufgaben über lange Dokumente diesem Muster ähneln. Es ist keine generelle Kontextschwäche, wohl aber ein Punkt, den man vor einer Architekturentscheidung an den eigenen Daten nachmisst.
Dazu kommt ein Transparenzhinweis aus dem Report selbst: Ein Kontaminationsvorfall betrifft vier QA-Bestandteile, GPQA und eine zurückgezogene Benchmark-Gruppe sind deshalb aus beiden Aggregaten ausgeschlossen. Das Konsortium legt den Vorfall in einem eigenen Abschnitt offen. Dass das Konsortium den Fehler dokumentiert, spricht für die Arbeitsweise, relativiert aber die Vergleichbarkeit einzelner Zahlen.
Für wen sich der Blick heute lohnt
Interessant ist das Modell für Unternehmen, bei denen deutschsprachige Verarbeitung im Kern steht und Datenhoheit ein hartes Kriterium ist. Nur ist die Reihenfolge derzeit eine andere als üblich: Weil der Zugang geschlossen ist, beginnt die Arbeit nicht mit dem Modell, sondern mit den eigenen Anforderungen. Klassifikation, Zusammenfassung, Extraktion aus deutschen Fachtexten sind die Aufgabenklassen, in denen die Benchmarkwerte am ehesten in Praxisqualität übersetzen. Die geringe Zahl aktiver Parameter macht den Betrieb dabei günstiger als bei dichten Modellen vergleichbarer Qualität, was für die Hardware-Rechnung aus unserem Artikel zum lokalen Betrieb von LLMs einen neuen Kandidaten ergibt.
Für den produktiven Einsatz sprechen drei Gründe dagegen, jedenfalls in diesem Quartal. Die Lizenz ist nicht final, das Basismodell hat keine Ausrichtung, und die Long-Context-Schwäche trifft genau die Architektur, die im Unternehmenseinsatz am häufigsten gebaut wird.
Sinnvoll ist deshalb ein Vorgehen in zwei Schritten. Jetzt lässt sich der eigene Anwendungsfall schärfen: Welche Aufgaben soll ein Modell übernehmen, welche Testdaten gibt es, welche Qualitätsschwelle muss erreicht werden? Dieser Testrahmen ist ohnehin nötig und modellunabhängig verwendbar. Sobald das offene Release vorliegt, angekündigt für dieses Jahr, folgt die Messung gegen den bestehenden Stack. Wer als Pilotanwender einsteigen möchte, erreicht das Konsortium über contact@soofi.info, sollte aber einplanen, dass der Partnerkreis bereits steht.
Fazit
Soofi S ist ein technisch ernstzunehmendes Modell und der bislang stärkste Beitrag zu einem europäischen Sprachmodell-Ökosystem. Produktionsreif ist es zum jetzigen Zeitpunkt nicht, und das sagt die Modellkarte selbst deutlicher als viele Artikel darüber. Wer souveräne KI plant, sollte es evaluieren und die Entwicklung verfolgen, die Architekturentscheidung aber nicht darauf aufbauen, bevor die Lizenzfrage geklärt ist. Bei der Bewertung, welches Modell zu welchem Anwendungsfall passt, und beim Aufbau der nötigen Infrastruktur unterstützen wir mit unserer KI-Beratung für den Mittelstand.
Quellen
Alle technischen Angaben und Benchmarkwerte in diesem Artikel stammen aus dem Technical Report des Soofi-Konsortiums, der Modellkarte auf Hugging Face und der Projektseite soofi.info. Den Zugangsstatus haben wir zuletzt am 18. August 2026 direkt gegen die Hugging-Face-API geprüft.
Häufige Fragen
Was ist Soofi S?
Soofi S ist ein offenes Sprachmodell für Deutsch und Englisch, entwickelt von einem deutschen Konsortium unter Koordination des KI Bundesverbands und gefördert vom Bundeswirtschaftsministerium. Es hat 31,6 Milliarden Parameter, von denen pro Token 3,2 Milliarden aktiv sind, und wurde auf der Industrial AI Cloud der Deutschen Telekom in München trainiert.
Ist Soofi S wirklich Open Source?
Noch nicht. Die Modellkarte auf Hugging Face weist das Modell als Beta-Preview und Forschungsartefakt aus, der Zugang ist gated und die Lizenz eine Closed Beta. Eine permissive Lizenz ohne Zugangsbeschränkung ist angekündigt, war Mitte August 2026 aber noch nicht in Kraft.
Kann man Soofi S produktiv einsetzen?
Derzeit nicht, und testen lässt es sich ebenfalls noch nicht: Alle Varianten stehen unter manueller Freigabe, Bewerbungen für die Testphase nimmt das Projekt aktuell nicht an. Gegen den produktiven Einsatz sprechen zudem die offene Lizenzfrage, fehlendes Safety-Tuning und die Schwäche bei sehr langen Kontexten.
Wie schlägt sich Soofi S gegen andere europäische Modelle?
In den Aggregatwerten für Deutsch und Englisch liegt Soofi S vor Olmo 3 32B und Apertus 70B, obwohl es weniger als halb so viele Parameter hat wie letzteres. Gegenüber europäischen Souveränitätsmodellen wie Teuken-7B, EuroLLM und Salamandra erreicht oder übertrifft es laut Report jeden deutschen Benchmark der Vergleichssuite, oft mit 10 bis 30 Punkten Abstand.