Bild & Video
Qwen3-TTS
im Test.
Qwen3-TTS ist eine Modellfamilie für Sprachsynthese, die das Qwen-Team von Alibaba Cloud am 22.01.2026 unter Apache 2.0 veröffentlicht hat. Fünf Modelle in den Größen 0.6B und 1.7B decken Stimmklonung aus 3 Sekunden Referenzaudio, 9 vorgefertigte Stimmen und den Entwurf einer Stimme aus einer Textbeschreibung ab, in 10 Sprachen einschließlich Deutsch. Die Gewichte stehen zum Herunterladen bereit, dieselben Modelle laufen daneben als kostenpflichtiger Dienst in Alibabas Cloud.
Stand 4. August 2026
| Preismodell | Kostenlos, Gewichte kostenlos unter Apache 2.0, Kosten nur für eigene GPU-Hardware. Der gehostete Dienst in Alibabas Cloud wird nach Nutzung abgerechnet. |
|---|---|
| Betriebsort | auf eigener Hardware |
| DSGVO | im Einzelfall zu prüfen |
| Quelloffen | ja, Apache-2.0 |
Alibaba hat die Gewichte am 22.01.2026 freigegeben, seither läuft Sprachsynthese mit Stimmklonung ohne Anbieterkonto auf einer eigenen Grafikkarte. Gemessen über alle 10 Sprachen liegt die Wortfehlerrate des 1.7B-Modells in 7 Fällen unter der von ElevenLabs, im Deutschen mit 1,235 gegen 0,572 darüber. Bei der Ähnlichkeit geklonter Stimmen kehrt sich das Verhältnis um. Im Deutschen steht Qwen3-TTS dort bei 0,775 gegen 0,614.
Wichtigste Funktionen
- Stimmklonung aus 3 Sekunden Referenzaudio: Die beiden Base-Modelle übernehmen eine Stimme aus einem kurzen Ausschnitt ohne Störgeräusche und sprechen damit jeden Text in allen 10 Sprachen. Für eine deutsche Firmenstimme ist das der praktikable Weg, weil keine der mitgelieferten Stimmen Deutsch als Muttersprache hat.
- Neun vorgefertigte Stimmen in den CustomVoice-Modellen: Fünf davon sind chinesisch, darunter je eine im Peking- und im Sichuan-Dialekt, dazu kommen 2 englische, eine japanische und eine koreanische Stimme. Jede spricht auf Wunsch jede unterstützte Sprache, der Hersteller empfiehlt aber die jeweilige Muttersprache.
- Stimmentwurf aus einer Beschreibung: Das Modell VoiceDesign erzeugt eine Stimme allein aus einem Satz wie “weiblich, warm, mittleres Tempo, professionell”, ohne jede Referenzaufnahme. Diese Variante gibt es nur in der Größe 1.7B.
- Steuerung über Anweisungen im Text: Tonfall, Sprechtempo und Gefühlslage nehmen die 1.7B-Modelle CustomVoice und VoiceDesign als normalen Text entgegen, etwa “ruhig und sachlich”. Dem 0.6B-Modell von CustomVoice fehlt diese Steuerung laut Modelltabelle des Herstellers.
- Streaming mit 97 Millisekunden bis zum ersten Audiopaket: Der Hersteller führt den Wert auf seine Dual-Track-Architektur zurück, die bereits nach einem einzelnen eingegebenen Zeichen zu senden beginnt. Für Telefonie und Sprachassistenten hängt an dieser Zahl die Wahl des Modells, unabhängig gegengeprüft ist sie nicht.
- Betrieb über vLLM und eigene Feinabstimmung: Der Modellserver vLLM unterstützt Qwen3-TTS seit dem Erscheinungstag, bislang für die Stapelverarbeitung, der Dauerbetrieb als Dienst ist angekündigt. Fertige Skripte für das Nachtrainieren einer Stimme oder einer Sprache liegen dem Projekt bei.
Preise und Tarife
Die Gewichte kosten nichts. Apache 2.0 deckt Modelle und Tokenizer ab und erlaubt die kommerzielle Nutzung ohne Rückfrage, Nutzungsgrenzen oder Guthaben gibt es nicht. Herunterzuladen sind rund 4,5 GB für die 1.7B-Modelle und rund 2,5 GB für die 0.6B-Modelle. Die laufenden Kosten stecken damit in der Hardware, denn die dokumentierten Beispiele laden das Modell in bfloat16 auf eine CUDA-Grafikkarte.
Daneben verkauft Alibaba dieselben Modelle als fertigen Dienst in Model Studio, ansprechbar über die DashScope-Schnittstelle. Einen Preis je Zeichen nennt die öffentliche Dokumentation für die Qwen3-TTS-Modelle nicht, aufgeführt ist nur das Anlegen einer geklonten Stimme mit knapp 1 Cent je Stimme (0,01 USD). In den ersten 90 Tagen nach der Freischaltung sind in der Region Singapur 1.000 Stimmen frei. Alibaba weist diese Beträge ohne Steuer aus, die Umsatzsteuer kommt auf der Rechnung hinzu.
Für wen ist Qwen3-TTS geeignet?
- Entwicklungsteams mit eigener GPU-Ausstattung: Wer Sprachausgabe fest in ein Produkt einbaut, zahlt einmal für Hardware statt laufend je erzeugtem Zeichen. Das Modell bindest du über ein Python-Paket ein, für den Dauerbetrieb über vLLM.
- Kliniken, Kanzleien und Verwaltungen mit sensiblen Vorlesetexten: Im lokalen Betrieb bleibt die gesamte Verarbeitung auf der eigenen Maschine, Telemetrie hat der Quelltext keine. Bei Patienten-, Mandanten- oder Bürgerdaten entfällt damit die Prüfung eines fremden Verarbeiters.
- Firmen, die eine wiedererkennbare Markenstimme aufbauen: Eine einmal geklonte Stimme nutzt du unbegrenzt, ohne Lizenzgebühr je Ausgabe. Im deutschen Vergleich des Herstellers trifft Qwen3-TTS die Vorlage genauer als ElevenLabs.
DSGVO und Datenschutz
Hinter Qwen3-TTS steht Alibaba Cloud in China, die Gewichte selbst stehen mit Apache 2.0 ohne Einschränkung bereit. Eine Suche im Quelltext nach Telemetrie sowie nach Analyse- und Absturzmeldediensten bleibt ohne Treffer, Netzzugriffe entstehen nur beim Herunterladen der Modelle von Hugging Face oder ModelScope. Dabei geht die IP-Adresse des ladenden Rechners an die jeweilige Plattform. Danach trennst du die Maschine vom Netz, die Synthese läuft weiter.
Neben dem Selbstbetrieb steht Alibabas eigene Cloud, in Model Studio laufen die Modelle qwen3-tts-flash-realtime, qwen3-tts-instruct-flash-realtime und die Klon-Fassung qwen3-tts-vc-realtime als gehosteter Dienst. Die Dokumentation nennt dafür ausschließlich Zugangsschlüssel der Regionen Singapur und Peking, eine EU-Region gibt es für diese Modelle nicht. Geklonte Stimmen speichert Alibaba dort unbefristet und löscht sie erst nach einem Jahr ohne Nutzung. Einen Auftragsverarbeitungsvertrag für den Europäischen Wirtschaftsraum veröffentlicht Alibaba samt EU-Standardvertragsklauseln, die Liste der Unterauftragnehmer steht allerdings erst nach Anmeldung im Kundenkonto bereit.
Das grüne Datenschutz-Abzeichen bekommt dieser Eintrag deshalb nicht mehr. In dieser Sammlung kippt eine Cloud beim Anbieter außerhalb der EU das Merkmal, auch wenn daneben der Selbstbetrieb steht und an der heruntergeladenen Fassung für sich genommen nichts zu beanstanden ist. Auf eigener Hardware bleibt der Betrieb davon unberührt, über die Schnittstelle in Singapur verarbeitest du außerhalb der EU. Bei geklonten Stimmen kommt unabhängig vom Betriebsweg die Einwilligung der sprechenden Person hinzu, denn ihre Stimme ist ein personenbezogenes Merkmal.
Alternativen zu Qwen3-TTS
- ElevenLabs: Cloud-Dienst aus den USA mit über 70 Sprachen. In Alibabas eigenem Vergleich spricht ElevenLabs Deutsch genauer aus, dafür rechnet der Dienst nach Guthaben ab und speichert die Daten dort.
- Chatterbox TTS: Steht quelloffen unter MIT-Lizenz und spricht 23 Sprachen, seit Juli 2026 läuft die Nano-Fassung auch auf Rechnern ohne Grafikkarte. Die Stimmklonung braucht dort etwa 5 Sekunden Referenzaudio.
- Piper TTS: Läuft auf der CPU und eignet sich für kleine Geräte, klont aber keine Stimmen. Eine neue Stimme entsteht nur über ein Training.
Wofür Qwen3-TTS taugt
- 10 Sprachen einschließlich Deutsch, dazu mehrere Dialektprofile
- Stimmklonung aus 3 Sekunden Referenzaudio, im Deutschen mit höherer Stimmähnlichkeit als ElevenLabs (0,775 gegen 0,614)
- Apache 2.0 für Modelle und Tokenizer, kommerzielle Nutzung ohne Auflagen
- Keine Telemetrie im Quelltext, Netzzugriff nur beim einmaligen Herunterladen des Modells
- vLLM unterstützt die Modelle seit dem Erscheinungstag, Skripte für eigene Feinabstimmung liegen bei
Wo es hakt
- Aussprachegenauigkeit im Deutschen unter ElevenLabs, Wortfehlerrate 1,235 gegen 0,572 in Alibabas eigener Messung
- Keine der 9 vorgefertigten Stimmen hat Deutsch als Muttersprache
- Dieselben Modelle laufen als Bezahldienst in Alibabas Cloud, mit Endpunkten in Singapur und Peking und ohne EU-Region
- Alle dokumentierten Beispiele laden das Modell auf eine CUDA-Grafikkarte, für reinen CPU-Betrieb nennt der Hersteller keine Messwerte
- Letzte Codeänderung am 17.03.2026, seither steht die Entwicklung still
Wofür es eingesetzt wird
Sprachausgabe in eigenen Anwendungen und Chatbots · Stimmklonung aus 3 Sekunden Referenzaudio · Mehrsprachige Sprachausgabe in 10 Sprachen einschließlich Deutsch · Sprachassistenten mit Streaming-Ausgabe · Schulungs- und Erklärmaterial vertonen