Speech & Voice
Sprach-KI in beide Richtungen — Spracherkennung/Transkription (STT) und Sprachsynthese (TTS), anbieterübergreifender Einsatzzweck, z. B. Whisper, Kokoro, ElevenLabs.
- AssemblyAI Universal-2 Speech & Voice
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
- Chatterbox Speech & Voice Open-Weight
Chatterbox ist ein quelloffenes Text-to-Speech-Modell von Resemble AI unter MIT-Lizenz. In Blindtests bevorzugten Hoerer es mehrheitlich gegenueber ElevenLabs; es bietet Emotionssteuerung, Voice-Cloning und niedrige Latenz.
- Deepgram Nova-3 Speech & Voice
Nova-3 ist Deepgrams Echtzeit-Speech-to-Text-Modell (Release Februar 2025) mit sehr niedriger Streaming-Latenz von rund 200 bis 300 Millisekunden, Keyterm-Prompting und Unterstuetzung fuer ueber 30 Sprachen.
- ElevenLabs v3 Speech & Voice
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
- Fish Audio S2 Speech & Voice Open-Weight
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
- Kokoro Speech & Voice Open-Weight
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
- NVIDIA Canary Speech & Voice Open-Weight
Canary ist NVIDIAs offene ASR- und Speech-Translation-Modellfamilie (CC-BY-4.0), die auf dem Open-ASR-Leaderboard bei englischer Genauigkeit vor OpenAI Whisper liegt und 25 europaeische Sprachen abdeckt.
- Whisper LLM-Grundlagen Speech & Voice
Whisper ist OpenAIs offenes Speech-to-Text-Modell von 2022 — ein mehrsprachiger Encoder-Decoder-Transformer, der Audio in Text umwandelt und in mehreren Größen unter MIT-Lizenz verfügbar ist.