Die Rangliste der offenen Sprachmodelle ändert sich derzeit im Wochenrhythmus. Für Schweizer KMU ist das kein Zuschauersport: Es entscheidet, ob «KI ohne Cloud-Abhängigkeit» eine Marketingfloskel bleibt oder eine reale, budgetierbare Option wird. Dieser Beitrag ordnet den aktuellen Stand ein – mit besonderem Blick auf die Modellklasse, die auf einer einzigen Consumer-Grafikkarte läuft.

Merksatz: Nicht die grösste Zahl an Parametern entscheidet für den KMU-Einsatz, sondern ob ein Modell auf vorhandener oder vertretbar teurer Hardware läuft, ohne dass Geschäftsdaten eine Cloud-Grenze überschreiten.

1. Die Spitzenklasse: gross, stark, aber nicht für den eigenen Server gedacht

An der Spitze der offenen Modelle liegt aktuell MiMo-V2.6-Pro von Xiaomi vorne, knapp gefolgt von GLM-5.3 (Zhipu/Z.ai) und Kimi K3 (Moonshot AI). Diese drei teilen sich die vorderen Plätze auf aktuellen Vergleichsplattformen – die genaue Reihenfolge verschiebt sich von Woche zu Woche, je nachdem, welches Labor zuletzt ein Update nachgeschoben hat. Für diesen Artikel zählt weniger die exakte Platzziffer als die Grössenordnung.

Und die ist beträchtlich: MiMo-V2.6-Pro bringt rund 1 Billion Parameter auf die Waage, Kimi K3 sogar 2,8 Billionen, GLM-5.3 liegt bei rund 753 Milliarden. Das sind Modelle, die auf mehreren gekoppelten Rechenzentrums-GPUs laufen – nicht auf einer Workstation im Serverraum. Für den KMU-Alltag heisst das: Diese Spitzenklasse erreicht man ausschliesslich über eine API, meist von einem Anbieter mit Sitz ausserhalb der Schweiz oder EU. Wer sie nutzt, nutzt wieder eine Cloud – nur eben eine andere als die gewohnte.

2. Die eigentlich relevante Klasse: 24 GB Grafikspeicher

Spannender für die meisten Unternehmen ist die Klasse direkt darunter – Modelle, die quantisiert (in 4-Bit-Kompression) auf einer einzigen Grafikkarte mit 24 GB Speicher laufen. Das ist keine exotische Hardware mehr: Eine RTX 4090 oder eine professionelle RTX 6000 mit dieser Speichergrösse ist für ein KMU-Budget erreichbar, einmalig zu beschaffen und dauerhaft im eigenen Haus zu betreiben.

Zwei Modelle dominieren diese Grössenklasse aktuell:

  • Qwen3.8-27B (Alibaba/Qwen) – ein 27-Milliarden-Parameter-Modell, das in der 4-Bit-Quantisierung komfortabel unter 24 GB Speicherbedarf bleibt und auf dem offiziellen Hugging-Face-Repository breite Verbreitung findet.
  • Muse Glimmer von Meta Superintelligence Labs – ein 30-Milliarden-Parameter-Modell, am 10. August 2026 unter der freien Apache-2.0-Lizenz veröffentlicht, ausdrücklich für «always-on»-Agenten-Workflows auf einer einzelnen Grafikkarte oder einem Mac mit genügend Arbeitsspeicher konzipiert.

Beide Modelle sind damit keine akademischen Demos, sondern für den Dauerbetrieb gebaut: Werkzeugaufrufe, mehrstufige Aufgaben, Fehlerbehandlung – genau das, was ein interner Assistent oder ein Automatisierungs-Agent im Tagesgeschäft braucht.

3. Warum das für Schweizer KMU praktisch zählt

Drei Punkte machen diese Entwicklung konkret interessant, nicht nur technisch:

Datenschutz als eingebaute Eigenschaft statt Vertragsklausel

Ein lokal betriebenes Modell verlässt das eigene Netz nicht. Anfragen, Dokumente, Kundendaten – alles bleibt auf Hardware, die dem Unternehmen gehört. Das ersetzt keine Auftragsverarbeitungsvereinbarung mit einem Cloud-Anbieter, macht sie für bestimmte, besonders sensible Anwendungsfälle aber schlicht überflüssig. Gerade für Branchen mit erhöhten Anforderungen an den Umgang mit Personendaten nach nDSG ist das ein Argument, das sich nicht wegdiskutieren lässt.

Kostenkontrolle ohne Token-Rechnung

API-Zugriff auf Spitzenmodelle wird nach Nutzung abgerechnet – bei wachsendem Einsatz eine Variable, die schwer zu budgetieren ist. Eine einmal beschaffte Grafikkarte verursacht Stromkosten und Abschreibung, aber keine laufende Rechnung pro Anfrage. Bei planbarem, wiederkehrendem Einsatz (interne Suche, Dokumentenauswertung, Erstentwürfe) kippt die Kostenrechnung ab einem gewissen Volumen zugunsten der eigenen Hardware.

Keine Abhängigkeit von einem einzelnen Anbieter

Wer auf offene Gewichte setzt, kann das Modell wechseln, ohne die gesamte Integration neu zu bauen. Das ist keine abstrakte Freiheit: Anbieter ändern Preise, Nutzungsbedingungen oder stellen Modelle ganz ein. Ein selbst gehostetes Modell unterliegt dieser Unsicherheit nicht.

Aber: Lokal gehostete Modelle verlangen eigenes Fachwissen für Betrieb, Aktualisierung und Absicherung. Wer das unterschätzt, tauscht Cloud-Abhängigkeit gegen Wartungsschulden – das ist kein Freifahrtschein, sondern eine andere Art von Verantwortung.

4. Einordnung: Nicht jedes Unternehmen braucht die Spitze

Die wichtigste Erkenntnis aus dieser Momentaufnahme ist eine Entwarnung: Die meisten KMU-Anwendungsfälle – interne Wissenssuche, Textentwürfe, einfache Datenauswertung, Kundenservice-Vorfilter – benötigen nicht die 2,8 Billionen Parameter von Kimi K3. Sie benötigen ein Modell, das zuverlässig, günstig zu betreiben und unter eigener Kontrolle ist. Genau dafür ist die 24-GB-Klasse mit Qwen3.8-27B und Muse Glimmer gebaut.

Die Spitzenmodelle bleiben relevant für Aufgaben, die tatsächlich maximale Modellfähigkeit brauchen – komplexe Recherche, anspruchsvolle Programmieraufgaben, Spezialfälle. Für den overwiegenden Alltag eines Schweizer KMU ist die kleinere, lokal betreibbare Klasse oft die wirtschaftlich und rechtlich sauberere Wahl. Wer unsicher ist, welche Klasse zum eigenen Anwendungsfall passt, sollte das anhand der vier Hebel zur KI-Vereinfachung und nicht anhand der aktuellen Leaderboard-Platzierung entscheiden.

5. Nächste Schritte

Diese Momentaufnahme wird in wenigen Monaten veraltet sein – das ist der Normalzustand in diesem Markt. Entscheidend ist nicht, jedes neue Modell zu verfolgen, sondern eine Entscheidungsgrundlage zu haben, die unabhängig vom aktuellen Leaderboard-Stand trägt: Welche Daten dürfen die Unternehmensgrenze verlassen, welches Budget ist für laufende API-Kosten gegenüber einmaliger Hardware vertretbar, und welches interne Wissen braucht es, ein Modell selbst zu betreiben. Diese drei Fragen beantwortet kein Ranking – sie beantwortet eine strukturierte Standortbestimmung vor der ersten Zeile Infrastruktur.

Quellen: Modellexistenz und Parametergrössen verifiziert über die offiziellen Hugging-Face-Repositories von XiaomiMiMo, zai-org, moonshotai und Qwen (Stand 3. Oktober 2026) sowie Metas offizielle Ankündigung zu Muse Glimmer vom 10. August 2026. Genaue Leaderboard-Platzierungen ändern sich laufend und wurden für diesen Artikel bewusst nicht mit einzelnen Punktzahlen zitiert.