Whisper large-v3
Verschriftet Aufnahmen in 99 Sprachen. Für Deutsch gibt es nachtrainierte Fassungen mit sehr tiefen Fehlerraten. Schweizerdeutsch bleibt schwierig: Selbst eigens angepasste Versionen liegen bei rund einem falschen Wort von vieren.
Übersicht · Stand 13. August 2026
Sag uns, was du tun willst und was für ein Gerät du hast. Wir nennen dir die Modelle, die dafür in Frage kommen.
Ein Modell, das gut zusammenfasst, muss nicht gut programmieren. Wähle links, was du brauchst. Rechts erscheinen alle Modelle, die das können, egal ob auf deinem Gerät, bei einem Anbieter gehostet oder als Cloud-Abo.
1 Was soll das Modell können?
Mehrfachauswahl möglich.
Wo es laufen darf
Standardmässig zeigen wir alle drei Wege nebeneinander, damit du vergleichen kannst.
Wähle links, was das Modell können soll. Passende Modelle erscheinen hier.
Häufig gesucht
Stell ein, was für ein Gerät du hast und wie du damit arbeitest. Wir zeigen, welche Aufgaben damit machbar sind, wie flüssig sie laufen und woran es sonst scheitert.
Für lokale KI braucht es keine eigene Grafikkarte. Ein Modell läuft auch nur mit Prozessor und normalem Arbeitsspeicher. Was fehlt, ist nicht die Fähigkeit, sondern das Tempo.
Der Arbeitsspeicher ist das Regal, in dem das Modell liegt. Der Prozessor ist ein Koch, der die Rezepte abarbeitet. Eine Grafikkarte sind Hunderte kleine Köche, die gleichzeitig rechnen, und der Grafikspeicher ist ihr Regal in Griffweite.
Der Arbeitsspeicher bestimmt, welches Modell Platz hat. Die Rechenleistung bestimmt, wie viel Geduld man braucht.
Richtwerte für quantisierte Modelle. Dazu kommt Reserve für das Programm, den Gesprächsverlauf und die internen Berechnungen.
10 von 10
Aufgaben sind damit machbar
11 GB bleiben für das Modell, das entspricht der Klasse Starkes Notebook.
Nur Prozessor. Etwa Lesegeschwindigkeit. Die Antwort baut sich sichtbar auf, für einen Absatz wartet man einige Sekunden. Für gelegentliche Fragen, Zusammenfassungen und einfache Dokumentenanalysen genügt das.
Alle Aufgaben sind bereits machbar. Mehr Arbeitsspeicher bringt hier grössere Modelle für dieselben Aufgaben, nicht mehr Aufgaben, und kein höheres Tempo.
Genaueres zu den genannten Modellen steht oben im Modellfinder.
Richtwerte. Bei mehreren gleichzeitigen Anfragen belegt jede ihren eigenen Gesprächsspeicher. Das Modell selbst wird nur einmal geladen, der Verlauf vervielfacht sich.
Der Begriff Small Language Model hat übrigens keine verbindliche Grenze. Microsoft nennt 10 Milliarden Parameter und bezeichnet gleichzeitig ein Modell mit 14 Milliarden als klein. Nützlicher als der Begriff sind die zwei Fragen oben.
Die Spalte Deutsch zeigt, wie belastbar unsere Aussage ist, nicht eine erfundene Note.
| Modell | Läuft ab | Speicher | Deutsch | Lizenz | Nachschauen |
|---|---|---|---|---|---|
| Qwen 3.5 | Smartphone | 0,8B ab 2 GB · 9B rund 8 GB · 27B rund 20 GB | Apache 2.0 | OllamaHugging Face | |
| Qwen 3 30B-A3B | Notebook 32 GB | rund 20 GB | Deutsch gut | Apache 2.0 | OllamaHugging Face |
| Apertus | Notebook | 8B rund 6 GB · 70B rund 45 GB | Deutsch gut | Apache 2.0 | Hugging Face |
| Gemma 4 | Smartphone | E4B rund 4 GB · 12B rund 10 GB · 31B rund 20 GB | Deutsch gut | Apache 2.0 | OllamaHugging Face |
| gpt-oss | Notebook 32 GB | 20B rund 14 GB · 120B über 60 GB | Deutsch gut | Apache 2.0 | OllamaHugging Face |
| Muse Glimmer | Desktop | rund 20 GB | Deutsch ungeprüft | Apache 2.0 | Hugging Face |
| Granite 4.1 | Notebook | 3B rund 3 GB · 8B rund 7 GB · 30B rund 20 GB | Apache 2.0 | OllamaHugging Face | |
| Ministral 3 | Smartphone | 3B rund 3 GB · 8B rund 7 GB · 14B rund 11 GB | Apache 2.0 | OllamaHugging Face | |
| Phi-4 | Notebook | 3,8B rund 3 GB · 14B rund 11 GB | Deutsch gut | MIT | OllamaHugging Face |
| SmolLM3 | Smartphone | rund 3 GB | Apache 2.0 | Hugging Face | |
| Teuken 7B | Notebook | rund 6 GB | Deutsch schwach | Apache 2.0 nur in der Variante mit dem Zusatz commercialmit Auflagen | Hugging Face |
| EuroLLM | Notebook | 9B rund 8 GB · 22B rund 16 GB | Deutsch gut | Apache 2.0 | Hugging Face |
| Nemotron 3 Nano | Desktop | rund 20 GB | Deutsch ungeprüft | NVIDIA Open Model Licensemit Auflagen | OllamaHugging Face |
| DeepSeek V4 | Server | mehrere hundert GB | Deutsch gut | MIT | Hugging Face |
| Mistral Large 3 und Small 4 | Server | ab rund 70 GB | Deutsch gut | Apache 2.0 | Hugging Face |
Ein Sprachmodell schreibt Text. Es hört nicht, es sieht nicht und es durchsucht keine Ablage. Dafür gibt es eigene, meist sehr kleine Modelle, die man mit einem Sprachmodell kombiniert.
Verschriftet Aufnahmen in 99 Sprachen. Für Deutsch gibt es nachtrainierte Fassungen mit sehr tiefen Fehlerraten. Schweizerdeutsch bleibt schwierig: Selbst eigens angepasste Versionen liegen bei rund einem falschen Wort von vieren.
Wandelt Texte in Zahlenreihen um, damit inhaltlich Ähnliches gefunden wird statt nur wortgleiche Treffer. Derzeit das stärkste frei verfügbare Modell dieser Art für mehrere Sprachen. Es antwortet nicht selbst.
Die bewährte Alternative, ausgelegt auf über hundert Sprachen und längere Abschnitte. Für gemischtsprachige Ablagen die robustere Wahl.
Liest Text aus Fotos, Belegen und Formularen in 32 Sprachen. Wichtig: Es ist ein einziges Modell, keine Verkettung aus Bilderkennung und Sprachmodell.
Auf Code spezialisiert und darauf trainiert, in einem Projekt selbstständig Dateien zu lesen und zu ändern. Die 30B-Variante läuft auf einem starken Arbeitsrechner.
Europäische Alternative zu Whisper, die Gesprochenes nicht nur verschriftet, sondern auch inhaltlich versteht. Achtung bei der Sprachausgabe: Dieser Teil darf nicht kommerziell genutzt werden.
Hersteller werben mit der Zahl unterstützter Sprachen. Das ist eine Zusage über die Trainingsdaten, keine Messung. Gemessen hat die deutsche Bundesdruckerei mit dem Fraunhofer-Institut: 39 Modelle an deutschsprachigen Verwaltungsaufgaben.
MÖVE-Vergleich der deutschen Bundesdruckerei, 39 geprüfte Modelle
Qwen3 mit 4 Milliarden Parametern steht auf Rang 8, direkt hinter GPT-4o. Ein Modell fürs Notebook liegt gleichauf mit einem aus dem Rechenzentrum. Die Auswahl lohnt sich mehr als das Aufrüsten.
Das eigens für die EU gebaute Teuken erreicht 47,7 Prozent im deutschen Wissenstest, das gleich grosse Llama von Meta 61,5. Für Deutsch trainiert zu sein, ersetzt kein gutes Training.
Der Vergleich prüft deutsche Verwaltungssprache und nimmt für die Werteprüfung Bezug auf das deutsche Grundgesetz. Für Schweizer Hochdeutsch, Helvetismen und hiesige Amtsbegriffe sagt er nichts aus. Einen vergleichbaren Schweizer Test gibt es bisher nicht, darum bleibt er der beste verfügbare Anhaltspunkt.
Das Schweizer Modell steht auf Rang 3, vor GPT-4o. Für Schweizerdeutsch gibt es trotzdem keine verlässliche lokale Lösung: Beim Verschriften von Mundart liegt etwa jedes vierte Wort daneben. Mehr zur Entstehung von Apertus in der Swiss AI Initiative.
Cloud-Modelle kann man nicht herunterladen. Als Massstab sind sie trotzdem der wichtigste Bezugspunkt.
Nur wenige Modelle sind auf Deutsch überhaupt gemessen. Für Claude Opus 5, GPT-5.6, DeepSeek V4, Qwen 3.5, Gemma 4 und Mistral Large 3 liegen bis heute keine Deutschwerte vor, obwohl sie längst verfügbar sind. Wir zeigen darum den letzten gemessenen Stand je Anbieter und kennzeichnen, was inzwischen abgelöst wurde. Der Wert für Gemini 3.1 Pro ist gerundet veröffentlicht, alle anderen auf eine Nachkommastelle.
Global MMLU, Deutschteil, erhoben von Artificial Analysis, Angaben in Prozent
Aussagekräftig ist die Grössenordnung, nicht die Rangfolge auf Zehntelpunkte: Zwischen dem besten Cloud-Modell und dem besten offenen Modell liegen rund vier Punkte, zwischen den Cloud-Modellen untereinander teils weniger als zwei.
Die offenen Spitzenmodelle brauchen einen Server. Was auf einem Notebook läuft, liegt bei anspruchsvollen Aufgaben weiterhin deutlich hinter ChatGPT. Bei klar umrissenen Aufgaben wie Zusammenfassen fällt der Unterschied kaum auf.
Für Einzelpersonen und unregelmässige Nutzung
Zwanzig Franken im Monat, nichts einzurichten, immer das stärkste Modell. Solange keine schützenswerten Daten im Spiel sind, ist das der pragmatische Weg.
Für sensible Daten und Unabhängigkeit
Nichts verlässt das Gerät, keine laufenden Kosten, funktioniert ohne Internet. Dafür weniger Leistung und etwas Einrichtungsaufwand.
Für Firmen und Teams
Offene Modelle bei einem Schweizer Anbieter. Verbindet brauchbare Leistung mit klarer Rechtslage, ohne dass jeder Arbeitsplatz eigene Hardware braucht.
Der dritte Weg ist wenig bekannt: Infomaniak, Swisscom, Exoscale betreiben offene Modelle in Schweizer Rechenzentren, teils mit Apertus. Man zahlt nach Nutzung, die Daten bleiben im Land. Wer statt einer Schnittstelle einen fertigen Chat sucht, findet die Anbieter unter Schweizer KI-Chats. Weitere Anbieter zeigt die Swiss AI Landscape.
Herunterladen kann man alle diese Modelle. Geschäftlich nutzen darf man sie nicht alle. Das ist der häufigste Stolperstein in Firmen.
Die einfache Regel: Steht beim Modell Apache 2.0 oder MIT, darfst du es ohne Rückfrage geschäftlich nutzen, verändern und weitergeben. Das trifft auf die meisten Modelle hier zu.
Bei allen anderen lohnt der Blick in die Lizenzdatei. Manche Hersteller erlauben nur Forschung und private Nutzung. Andere setzen eine Obergrenze bei der Zahl der Nutzer. Innerhalb derselben Modellfamilie können die Bedingungen auseinandergehen, darum die Lizenz des konkreten Modells prüfen, nicht die des Herstellers allgemein. Für die KI-Strategie im Unternehmen als Ganzes bietet der Verband ein eigenes Praxis-Paket.
Geht, aber nicht beliebig. Diese vier Fälle begegnen einem am häufigsten.
Suchmodell, dann Sprachmodell
Das Suchmodell findet die passenden Stellen in deinen Unterlagen, das Sprachmodell formuliert daraus die Antwort. Zwei Modelle laufen gleichzeitig, ihr Speicherbedarf addiert sich. Das ist der verbreitetste Aufbau überhaupt und in Werkzeugen wie AnythingLLM oder Open WebUI fertig eingebaut.
Spracherkennung, dann Sprachmodell
Whisper erzeugt den Text, das Sprachmodell macht daraus ein Protokoll. Die beiden laufen nacheinander, nicht gleichzeitig, darum genügt der Speicher für das grössere der beiden.
Ein einziges Modell
Hier braucht es keine Kombination. Modelle wie Qwen3-VL oder Gemma 4 enthalten die Bilderkennung bereits. Wer ein Bildmodell und ein Sprachmodell hintereinanderhängt, verliert Qualität, statt zu gewinnen.
Kleines Entwurfsmodell, dann grosses Modell
Ein kleines Modell rät mehrere Wörter voraus, das grosse prüft sie in einem Zug. Die Antwortqualität bleibt gleich, das Tempo steigt. Auf üblicher Hardware sind es Faktor eineinhalb bis zwei, nicht das oft versprochene Vielfache.
Eine Regel gilt überall: Laufen zwei Modelle gleichzeitig, addiert sich ihr Speicherbedarf vollständig. Laufen sie nacheinander, genügt der Platz für das grössere.
Damit du nachprüfen kannst, was hier steht.
Recherche, Zusammenstellung und Umsetzung erfolgten mit Unterstützung von KI. Alle Angaben wurden gegen die oben verlinkten Originalquellen geprüft. Was sich nicht belegen liess, steht nicht auf dieser Seite.
Modellversionen, Lizenzen und Messwerte ändern sich schnell. Fehlt ein Modell oder stimmt eine Angabe nicht mehr? Schreib uns, wir nehmen es auf.
Wir verfolgen die Entwicklung offener Modelle für die Schweiz und melden, was sich ändert.