Die Rangliste der offenen Sprachmodelle ändert sich derzeit im Wochenrhythmus. Für Schweizer KMU ist das kein Zuschauersport: Es entscheidet, ob «KI ohne Cloud-Abhängigkeit» eine Marketingfloskel bleibt oder eine reale, budgetierbare Option wird. Dieser Beitrag ordnet den aktuellen Stand ein – mit besonderem Blick auf die Modellklasse, die auf einer einzigen Consumer-Grafikkarte läuft.
1. Die Spitzenklasse: gross, stark, aber nicht für den eigenen Server gedacht
An der Spitze der offenen Modelle liegt aktuell MiMo-V2.6-Pro von Xiaomi vorne, knapp gefolgt von GLM-5.3 (Zhipu/Z.ai) und Kimi K3 (Moonshot AI). Diese drei teilen sich die vorderen Plätze auf aktuellen Vergleichsplattformen – die genaue Reihenfolge verschiebt sich von Woche zu Woche, je nachdem, welches Labor zuletzt ein Update nachgeschoben hat. Für diesen Artikel zählt weniger die exakte Platzziffer als die Grössenordnung.
Und die ist beträchtlich: MiMo-V2.6-Pro bringt rund 1 Billion Parameter auf die Waage, Kimi K3 sogar 2,8 Billionen, GLM-5.3 liegt bei rund 753 Milliarden. Das sind Modelle, die auf mehreren gekoppelten Rechenzentrums-GPUs laufen – nicht auf einer Workstation im Serverraum. Für den KMU-Alltag heisst das: Diese Spitzenklasse erreicht man ausschliesslich über eine API, meist von einem Anbieter mit Sitz ausserhalb der Schweiz oder EU. Wer sie nutzt, nutzt wieder eine Cloud – nur eben eine andere als die gewohnte.
2. Die eigentlich relevante Klasse: 24 GB Grafikspeicher
Spannender für die meisten Unternehmen ist die Klasse direkt darunter – Modelle, die quantisiert (in 4-Bit-Kompression) auf einer einzigen Grafikkarte mit 24 GB Speicher laufen. Das ist keine exotische Hardware mehr: Eine RTX 4090 oder eine professionelle RTX 6000 mit dieser Speichergrösse ist für ein KMU-Budget erreichbar, einmalig zu beschaffen und dauerhaft im eigenen Haus zu betreiben.
Zwei Modelle dominieren diese Grössenklasse aktuell:
- Qwen3.8-27B (Alibaba/Qwen) – ein 27-Milliarden-Parameter-Modell, das in der 4-Bit-Quantisierung komfortabel unter 24 GB Speicherbedarf bleibt und auf dem offiziellen Hugging-Face-Repository breite Verbreitung findet.
- Muse Glimmer von Meta Superintelligence Labs – ein 30-Milliarden-Parameter-Modell, am 10. August 2026 unter der freien Apache-2.0-Lizenz veröffentlicht, ausdrücklich für «always-on»-Agenten-Workflows auf einer einzelnen Grafikkarte oder einem Mac mit genügend Arbeitsspeicher konzipiert.
Beide Modelle sind damit keine akademischen Demos, sondern für den Dauerbetrieb gebaut: Werkzeugaufrufe, mehrstufige Aufgaben, Fehlerbehandlung – genau das, was ein interner Assistent oder ein Automatisierungs-Agent im Tagesgeschäft braucht.
3. Warum das für Schweizer KMU praktisch zählt
Drei Punkte machen diese Entwicklung konkret interessant, nicht nur technisch:
Datenschutz als eingebaute Eigenschaft statt Vertragsklausel
Ein lokal betriebenes Modell verlässt das eigene Netz nicht. Anfragen, Dokumente, Kundendaten – alles bleibt auf Hardware, die dem Unternehmen gehört. Das ersetzt keine Auftragsverarbeitungsvereinbarung mit einem Cloud-Anbieter, macht sie für bestimmte, besonders sensible Anwendungsfälle aber schlicht überflüssig. Gerade für Branchen mit erhöhten Anforderungen an den Umgang mit Personendaten nach nDSG ist das ein Argument, das sich nicht wegdiskutieren lässt.
Kostenkontrolle ohne Token-Rechnung
API-Zugriff auf Spitzenmodelle wird nach Nutzung abgerechnet – bei wachsendem Einsatz eine Variable, die schwer zu budgetieren ist. Eine einmal beschaffte Grafikkarte verursacht Stromkosten und Abschreibung, aber keine laufende Rechnung pro Anfrage. Bei planbarem, wiederkehrendem Einsatz (interne Suche, Dokumentenauswertung, Erstentwürfe) kippt die Kostenrechnung ab einem gewissen Volumen zugunsten der eigenen Hardware.
Keine Abhängigkeit von einem einzelnen Anbieter
Wer auf offene Gewichte setzt, kann das Modell wechseln, ohne die gesamte Integration neu zu bauen. Das ist keine abstrakte Freiheit: Anbieter ändern Preise, Nutzungsbedingungen oder stellen Modelle ganz ein. Ein selbst gehostetes Modell unterliegt dieser Unsicherheit nicht.
4. Einordnung: Nicht jedes Unternehmen braucht die Spitze
Die wichtigste Erkenntnis aus dieser Momentaufnahme ist eine Entwarnung: Die meisten KMU-Anwendungsfälle – interne Wissenssuche, Textentwürfe, einfache Datenauswertung, Kundenservice-Vorfilter – benötigen nicht die 2,8 Billionen Parameter von Kimi K3. Sie benötigen ein Modell, das zuverlässig, günstig zu betreiben und unter eigener Kontrolle ist. Genau dafür ist die 24-GB-Klasse mit Qwen3.8-27B und Muse Glimmer gebaut.
Die Spitzenmodelle bleiben relevant für Aufgaben, die tatsächlich maximale Modellfähigkeit brauchen – komplexe Recherche, anspruchsvolle Programmieraufgaben, Spezialfälle. Für den overwiegenden Alltag eines Schweizer KMU ist die kleinere, lokal betreibbare Klasse oft die wirtschaftlich und rechtlich sauberere Wahl. Wer unsicher ist, welche Klasse zum eigenen Anwendungsfall passt, sollte das anhand der vier Hebel zur KI-Vereinfachung und nicht anhand der aktuellen Leaderboard-Platzierung entscheiden.
5. Nächste Schritte
Diese Momentaufnahme wird in wenigen Monaten veraltet sein – das ist der Normalzustand in diesem Markt. Entscheidend ist nicht, jedes neue Modell zu verfolgen, sondern eine Entscheidungsgrundlage zu haben, die unabhängig vom aktuellen Leaderboard-Stand trägt: Welche Daten dürfen die Unternehmensgrenze verlassen, welches Budget ist für laufende API-Kosten gegenüber einmaliger Hardware vertretbar, und welches interne Wissen braucht es, ein Modell selbst zu betreiben. Diese drei Fragen beantwortet kein Ranking – sie beantwortet eine strukturierte Standortbestimmung vor der ersten Zeile Infrastruktur.