KI-Modelle
Konkrete KI-Modelle und Modellfamilien im Überblick — wer sie entwickelt, wie sie sich in Reasoning, Coding, Multimodalität und Preis unterscheiden und wofür die einzelnen Linien im Alltag am besten taugen. Gegliedert nach Anbieter-Familien (GPT, Claude, Gemini …) und übergreifenden Einsatzzwecken wie Security, Bild & Video oder Open-Weight.
- $/MTok (Kosten pro Million Tokens) API-Nutzung LLM-Pricing
Standard-Preisangabe bei KI-APIs — Kosten in US-Dollar pro eine Million verarbeitete Tokens. Wird getrennt für Input, Output und ggf. Cache angegeben.
- AssemblyAI Universal-2 Speech & Voice
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
- Batch-API API-Nutzung LLM-Pricing
Asynchroner API-Modus, bei dem viele Anfragen gesammelt und mit deutlichem Preisrabatt verarbeitet werden — Ergebnisse liegen meist innerhalb von 24 Stunden vor.
- Chatterbox Speech & Voice Open-Weight
Chatterbox ist ein quelloffenes Text-to-Speech-Modell von Resemble AI unter MIT-Lizenz. In Blindtests bevorzugten Hoerer es mehrheitlich gegenueber ElevenLabs; es bietet Emotionssteuerung, Voice-Cloning und niedrige Latenz.
- Claude Fable 5 Claude
Claude Fable 5 ist Anthropics erstes öffentlich verfügbares Modell der Mythos-Klasse, veröffentlicht im Juni 2026. Es ist auf anspruchsvollstes Schlussfolgern und langlaufende agentische Arbeit ausgelegt und bietet ein 1-Million-Token-Kontextfenster.
- Claude Fable 5.1 Claude
Am 1. September 2026 veröffentlichtes Spitzenmodell der Claude-Fable-Linie von Anthropic. Frontier-Modell für anspruchsvolles Reasoning, Coding, Recherche und lange Agenten-Läufe; 1M-Token-Kontext, multimodale Eingabe, proprietärer Zugang über API und Claude-Apps.
- Claude Haiku 4.5 Claude
Claude Haiku 4.5 ist Anthropics schnelles Kompaktmodell vom Oktober 2025 — bringt Sonnet-4-nahe Leistung bei rund einem Drittel der Kosten und ist das erste Haiku-Modell mit Reasoning.
- Claude Mythos Claude
Claude Mythos (April 2026) ist Anthropics bisher leistungsstärkstes Modell — ein neuer Tier oberhalb der Opus-Reihe, primär verteilt über das Glasswing-Programm an Cybersecurity-Defender.
- Claude Mythos 5 Claude
Claude Mythos 5 (9. Juni 2026) ist Anthropics leistungsstärkste Modell-Linie oberhalb von Opus — technisch identisch mit Fable 5, aber ohne dessen Sicherheits-Klassifikatoren, verteilt über Project Glasswing.
- Claude Mythos 5.1 Claude
Claude Mythos 5.1 (September 2026) ist Anthropics Frontier-Modell fuer geprüfte Cyber- und Life-Science-Organisationen — dasselbe Modell wie Fable 5.1, nur mit freizuegigeren Safeguards.
- Claude Opus 4.5 Claude
Claude Opus 4.5 ist Anthropics Top-Tier-Modell vom November 2025 — der direkte Vorgänger von Opus 4.6, bringt „Infinite Chats" und deutlich reduzierten Token-Verbrauch.
- Claude Opus 4.8 Claude
Claude Opus 4.8 ist das im Mai 2026 veröffentlichte Spitzenmodell der Opus-Linie von Anthropic. Es zielt auf agentisches Programmieren, komplexes Schlussfolgern und Computer-Nutzung und gilt als schrittweise, aber messbare Verbesserung gegenüber Opus 4.7.
- Claude Opus 5 Claude
Am 24. Juli 2026 veröffentlichtes Spitzenmodell der Claude-Opus-Linie von Anthropic. Positioniert als leistungsstarkes Alltagsmodell für Wissensarbeit, Coding und Agenten; Zugang proprietär über Claude-App und API (Modell-ID claude-opus-5).
- Claude Sonnet 4.5 Claude
Claude Sonnet 4.5 (September 2025) ist Anthropics auf Agenten und Coding optimiertes Modell der Sonnet-Linie — bei Erscheinen fuehrend auf SWE-bench Verified, inzwischen von neueren Sonnet-Versionen abgeloest.
- Claude Sonnet 4.6 Claude
Claude Sonnet 4.6 ist Anthropics mittleres Modell vom Februar 2026 — nahe an Opus-Niveau, mit 1-Mio.-Token-Kontext und unveraendertem Sonnet-Preis von 3/15 USD pro Mio. Token.
- Claude Sonnet 5 Claude
Claude Sonnet 5 ist Anthropics Mittelklasse-Modell vom 30. Juni 2026 — das bislang agentischste Sonnet, mit Leistung nahe Opus 4.8 bei 2 USD Input und 10 USD Output je 1 Mio. Tokens.
- Claude Sonnet 5.5 Claude
Claude Sonnet 5.5 (28. September 2026) ist Anthropics günstiges Mittelklasse-Modell — eine schnellere, preiswertere Ergänzung zu Opus 5.5, mit 2/10 $ je 1 Mio. Token und dem Spitzenwert bei Terminal-Bench 4.0. Über boostN nutzbar.
- Code Llama Llama
Code Llama ist Metas auf Programmierung spezialisierte Llama-2-Variante vom August 2023 — offen gewichtet, in mehreren Größen und mit Basis-, Python- und Instruct-Ausprägungen.
- Codestral Mistral
Codestral ist Mistral AIs auf Code spezialisiertes Modell (erstmals Mai 2024) — ein 22-Mrd.-Parameter-Modell für Code-Vervollständigung und -Generierung, ursprünglich als offene Gewichte veröffentlicht.
- Deepgram Nova-3 Speech & Voice
Nova-3 ist Deepgrams Echtzeit-Speech-to-Text-Modell (Release Februar 2025) mit sehr niedriger Streaming-Latenz von rund 200 bis 300 Millisekunden, Keyterm-Prompting und Unterstuetzung fuer ueber 30 Sprachen.
- DeepSeek Janus-Pro-7B DeepSeek
Janus-Pro-7B ist DeepSeeks Open-Source-Multimodal-Modell vom Januar 2025 — vereint Bildverstehen und Bildgenerierung in einer einzigen 7B-Architektur, MIT-lizenziert.
- DeepSeek R1 DeepSeek
Am 20. Januar 2025 unter MIT-Lizenz veröffentlichtes offenes Reasoning-Modell des chinesischen Labors DeepSeek. Mixture-of-Experts mit 671 Mrd. Parametern (37 Mrd. pro Token aktiv), stark über Reinforcement Learning trainiert; erreichte als erstes offenes Modell OpenAIs o1-Niveau.
- DeepSeek V3 DeepSeek
DeepSeek V3 ist ein im Dezember 2024 veröffentlichtes offenes KI-Modell des chinesischen Anbieters DeepSeek. Es nutzt eine Mixture-of-Experts-Architektur mit 671 Milliarden Parametern (37 Mrd. aktiv je Token) und rund 128.000 Tokens Kontext.
- DeepSeek V3.1 DeepSeek
DeepSeek V3.1 ist das Open-Weights-Hybridmodell von DeepSeek vom August 2025 — vereint Think- und Non-Think-Modus in einem Modell, mit 128K-Kontext und starken Agenten-Fähigkeiten.
- DeepSeek V3.2 DeepSeek
DeepSeek V3.2 (1. Dezember 2025) ist ein offenes MoE-Modell mit 685 Mrd. Parametern unter MIT-Lizenz — dank DeepSeek Sparse Attention besonders effizient bei langen Kontexten.
- DeepSeek V4 DeepSeek
DeepSeek V4 (April 2026) ist die vierte Generation des chinesischen Open-Weight-MoE-Modells — als Pro (1,6 T Parameter) und Flash (284 B) unter MIT-Lizenz veröffentlicht, mit 1-Mio.-Tokens-Kontext.
- DeepSeek V4-Flash DeepSeek
DeepSeek V4-Flash (Juli 2026) ist ein offenes MoE-Modell mit 284 Mrd. Parametern (13 Mrd. aktiv), 1-Mio.-Token-Kontext und MIT-Lizenz — frei ladbar auf Hugging Face.
- DeepSeek V4-Pro DeepSeek
DeepSeek V4-Pro (2026) ist das Open-Weight-Flaggschiff von DeepSeek — ein 1,6-Billionen-Parameter-MoE mit rund 49B aktiven Parametern pro Token, 1-Mio.-Tokens-Kontext und MIT-Lizenz.
- DeepSeek V4.1-Flash DeepSeek
DeepSeek V4.1-Flash (10. September 2026) ist das kleinste Modell der neuen DeepSeek-V4.1-Architektur — erste DeepSeek-Familie mit nativer multimodaler Bildverarbeitung. Speed-/kosten-optimiertes „Flash"-Modell mit offenen Gewichten (MIT), über boostN nutzbar.
- Devstral Mistral
Devstral ist Mistral AIs offenes Agenten-Modell für Software-Engineering (Mai 2025) — trainiert darauf, echte GitHub-Issues zu lösen, und stark auf SWE-bench Verified.
- ElevenLabs v3 Speech & Voice
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
- Fish Audio S2 Speech & Voice Open-Weight
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
- FLUX.2 Bild & Video Open-Weight
FLUX.2 ist die Text-zu-Bild-Modellfamilie von Black Forest Labs. Sie umfasst die proprietaeren Varianten Pro und Flex sowie das offene 32-Mrd.-Parameter-Modell Dev und die kompakte Klein-Reihe, die Bilderzeugung und Bildbearbeitung in einem Modell vereinen.
- Foundation-Sec-8B Security-Modelle Open-Weight
Foundation-Sec-8B ist Cisco Foundation AIs offenes, auf Cyber-Security spezialisiertes Sprachmodell (2025). Es erweitert Llama-3.1-8B durch fortgesetztes Pretraining auf rund 5 Mrd. Security-Tokens und steht unter Apache-2.0-Lizenz frei zur Verfügung.
- Gemini 3 Flash Gemini
Gemini 3 Flash ist Googles schnelles, günstiges Thinking-Modell vom 17. Dezember 2025 — Pro-nahe Reasoning-Leistung bei 1 Mio. Token Kontext, ausgelegt auf agentische Workflows und Coding.
- Gemini 3 Pro Gemini
Gemini 3 Pro (November 2025) ist Googles drittes Flaggschiff-Modell mit 1-Mio.-Tokens-Kontextfenster und nativer Multimodalität — inzwischen abgelöst von Gemini 3.1 Pro.
- Gemini 3.1 Pro Gemini
Gemini 3.1 Pro (Februar 2026) ist Googles aktuelles Top-Modell — 1-Mio.-Tokens-Kontext, 64K Output-Tokens, verdoppelte Reasoning-Leistung gegenüber Gemini 3 Pro.
- Gemini 3.5 Flash Gemini
Gemini 3.5 Flash ist Googles hocheffizientes Multimodal-Modell vom Mai 2026 — bringt Pro-nahe Coding- und Reasoning-Qualität zu Flash-typischen Kosten und Geschwindigkeit.
- Gemini 3.6 Flash Gemini
Gemini 3.6 Flash (Juli 2026) ist Googles schnelle, kostenguenstige Flash-Stufe mit 1-Mio.-Tokens-Kontext — auf hohen Durchsatz und niedrige Kosten pro Anfrage ausgelegt.
- Gemini 3.7 Flash Gemini
Gemini 3.7 Flash (August 2026) ist Googles schnelles Workhorse-Modell fuer Coding und Agenten — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, halb so teuer wie 3.6 Flash.
- Gemini 3.8 Flash Gemini
Gemini 3.8 Flash (September 2026) ist Googles intelligentestes Workhorse-Modell fuer Coding, Agenten und mehrstufiges Reasoning — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, direkter Nachfolger von 3.7 Flash.
- Gemma 3 Gemma
Gemma 3 ist die im März 2025 veröffentlichte Familie offener KI-Modelle von Google. Sie umfasst vier Größen (1B, 4B, 12B, 27B), ist ab 4B multimodal, unterstützt über 140 Sprachen und bietet bis zu 128.000 Tokens Kontext.
- Gemma 3n Gemma
Offenes, mobil-first ausgelegtes KI-Modell von Google, als Preview im Mai 2025 und voll ab 26. Juni 2025 verfügbar. Multimodal (Text, Bild, Audio, Video), auf Geräte-Betrieb optimiert; offene Gewichte in den Größen E2B und E4B.
- Gemma 4 Gemma
Gemma 4 ist Google DeepMinds offene Modellfamilie vom April 2026 — vier Größen (E2B bis 31B), 256k-Kontext, Multimodalität, Apache-2.0-Lizenz.
- GLM-4.5 Zhipu AI
GLM-4.5 ist ein im Juli 2025 veröffentlichtes offenes KI-Modell von Zhipu AI (Z.ai). Es ist ein agent-natives Mixture-of-Experts-Modell mit 355 Milliarden Parametern (32 Mrd. aktiv), 128.000 Tokens Kontext und MIT-Lizenz.
- GLM-4.6 Zhipu AI
GLM-4.6 ist Zhipu AIs Open-Weight-MoE-Modell vom September 2025 — 355 Mrd. Parameter (32B aktiv), 200k-Kontext, MIT-lizenziert, mit Schwerpunkt auf Coding-Performance.
- GLM-4.7 Zhipu AI
GLM-4.7 (Dezember 2025) ist Zhipu AIs offenes Coding-Flaggschiff — ein MoE-Modell mit rund 400 Mrd. Parametern, 200K-Input-Kontext und dem Feature „Preserved Thinking".
- GLM-5 Zhipu AI
Im Februar 2026 unter MIT-Lizenz veröffentlichtes offenes Modell von Zhipu AI (Z.AI). Mixture-of-Experts mit rund 744 Mrd. Parametern (ca. 40 Mrd. pro Token aktiv), 200K-Kontext, Fokus auf Coding und Agenten. Frei herunterladbar über Hugging Face.
- GLM-5.1 Zhipu AI
GLM-5.1 ist Z.ais Open-Source-Flaggschiff vom April 2026 — 744 Mrd. Parameter (40B aktiv), 200k-Kontext, ausgelegt auf agentisches Coding mit bis zu 8 Stunden autonomer Laufzeit.
- GLM-5.2 Zhipu AI
GLM-5.2 (Juni 2026) ist das Open-Weight-Modell von Zhipu AI (Z.ai) — ein MoE mit rund 744B Parametern (~40B aktiv), 1-Mio.-Tokens-Kontext und MIT-Lizenz, stark bei agentischem Coding.
- GLM-5.3 Zhipu AI
GLM-5.3 ist Zhipu AIs Open-Weights-Modell vom August 2026 — ein MoE-Modell mit Fokus auf Coding und Cybersecurity, das bei agentischen Benchmarks die Spitze der offenen Modelle erreicht.
- Google Imagen Bild & Video
Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 erschien 2025 in den Stufen Fast, Generate und Ultra, ist ueber Gemini API und Vertex AI verfuegbar und bekannt fuer starke Typografie und Prompt-Treue.
- GPT Astra GPT Security-Modelle
GPT-6 Astra ist OpenAIs Flaggschiff vom September 2026 — erstes Modell auf der Preparedness-Stufe Critical, mit Schwerpunkt auf Computer-Use und Cybersecurity.
- GPT Image 2 Bild & Video
GPT Image 2 ist OpenAIs natives Bildmodell (April 2026), das vor dem Zeichnen schließt, sehr zuverlässig Text rendert und in hoher Auflösung fotorealistische Bilder erzeugt.
- GPT Luna GPT
GPT Luna (GPT-5.6 Luna) ist das kleinste, schnellste und günstigste Modell der im Juli 2026 veröffentlichten GPT-5.6-Familie von OpenAI. Es ist für kostensensible Massen-Workloads ausgelegt und bietet ein Kontextfenster von rund 1,05 Millionen Tokens.
- GPT Sol GPT
GPT-5.6 Sol ist OpenAIs Flaggschiff vom Juli 2026 — Spitzenmodell einer neuen Sonnensystem-Familie (Sol, Terra, Luna) mit Fokus auf Coding, Wissenschaft und Cybersecurity.
- GPT Terra GPT
GPT Terra ist die mittlere Stufe von OpenAIs GPT-5.6-Familie (Juli 2026) zwischen dem sparsamen Luna und dem Flaggschiff Sol — mit 1-Mio.-Tokens-Kontext auf ein starkes Preis-Leistungs-Verhaeltnis ausgelegt.
- GPT-4o GPT
GPT-4o (Mai 2024) war OpenAIs erstes nativ multimodales Modell — Text, Audio und Bild in einem einheitlichen Modell, mit Echtzeit-Sprachmodus und deutlich niedrigeren Kosten als GPT-4 Turbo.
- GPT-4o mini GPT
GPT-4o mini (Juli 2024) ist OpenAIs kleine, günstige Variante von GPT-4o — als Ablösung für GPT-3.5 Turbo positioniert, deutlich stärker bei spürbar niedrigerem Preis pro Token.
- GPT-5.2 GPT
GPT-5.2 ist OpenAIs Modell-Generation vom Dezember 2025 — drei Varianten (instant, thinking, Pro), 400k-Kontextfenster und neuer Stand der Technik bei beruflicher Wissensarbeit.
- GPT-5.3 GPT
GPT-5.3 ist eine Iteration der GPT-5-Reihe von OpenAI — die Instant-Variante kam am 3. März 2026 und fokussiert sich auf Faktentreue, kürzere Vorreden und natürlicheren Konversationsfluss.
- GPT-5.3-Codex GPT
GPT-5.3-Codex ist OpenAIs spezialisiertes agentisches Coding-Modell (Februar 2026), Nachfolger von GPT-5.2-Codex — 25 % schneller, mit deutlichen Sprüngen bei Terminal-Bench und OSWorld.
- GPT-5.3-Codex-Spark GPT
GPT-5.3-Codex-Spark ist OpenAIs Coding-Modell vom Februar 2026 — eine kleinere, real-time-optimierte Variante von GPT-5.3-Codex mit über 1000 Tokens pro Sekunde auf Cerebras-Hardware.
- GPT-5.4 GPT
GPT-5.4 ist OpenAIs Reasoning-Modell vom 5. März 2026 — erstes Mainline-Modell mit den Coding-Fähigkeiten von GPT-5.3-codex, nativer Computer-Use-Steuerung und 1-Mio.-Tokens-Kontext.
- GPT-5.5 GPT
GPT-5.5 ist OpenAIs Flaggschiff vom 23. April 2026 — positioniert als „smartestes und intuitivstes Modell" und gedacht als Schritt Richtung KI, die selbstständig durch Tools arbeitet.
- GPT-6.1 Sol GPT
GPT-6.1 Sol (29. September 2026) ist OpenAIs günstiges Coding- und Agenten-Modell — Nachfolger von GPT-6 Sol nach nur sieben Tagen, mit nahezu der Intelligenz von GPT-6 Astra zu rund einem Fünftel des Preises. Über boostN nutzbar.
- GPT-Live-1 GPT
Echtzeit-Sprachmodell von OpenAI, seit 8. Juli 2026 die Standard-Sprachfunktion in ChatGPT. Hört und spricht gleichzeitig (bidirektional), erlaubt Unterbrechungen und reicht komplexe Fragen an ein stärkeres Textmodell weiter. Proprietärer Zugang über ChatGPT.
- Grok 3 Grok
Am 17. Februar 2025 veröffentlichtes Reasoning-Modell von xAI (Elon Musks KI-Firma). Trainiert auf dem Colossus-Supercluster, mit „Think"-Reasoning und DeepSearch sowie Echtzeit-Zugriff auf X. Proprietärer Zugang über die Grok-App und API.
- Grok 4 Grok
Grok 4 ist xAIs Reasoning-Modell vom Juli 2025 — Text- und Bild-Eingabe, 256k-Kontext, trainiert per Reinforcement Learning auf dem 200.000-GPU-Cluster Colossus.
- Grok 4.1 Grok
Grok 4.1 ist das im November 2025 veröffentlichte KI-Modell von xAI. Es liefert natürlichere Dialoge, weniger Halluzinationen und bessere Stilkontrolle und ist in zwei Varianten verfügbar: einer direkt antwortenden und einer vorab schlussfolgernden (Thinking).
- Grok 4.3 Grok
Grok 4.3 ist xAIs Reasoning-orientiertes Modell vom April 2026 — mit 1-Mio.-Token-Kontext, nativer Video-Eingabe und Fokus auf agentische Workflows und faktische Genauigkeit.
- Grok 4.5 Grok
Grok 4.5 ist xAIs Frontier-Modell vom Juli 2026 für Coding, agentische Aufgaben und Wissensarbeit — hohe Token-Effizienz bei 2 USD Input und 6 USD Output je 1 Mio. Tokens.
- Grok 4.6 Grok
Grok 4.6 (August 2026) ist xAIs Flaggschiff-Modell fuer langlaufende agentische Arbeit — 500k-Token-Kontext, Text- und Bild-Input, gestaffelter Preis ab 2/6 USD pro Mio. Token.
- Hunyuan3D 2.0 3D-Modelle Open-Weight
Hunyuan3D 2.0 ist Tencents offenes generatives 3D-Modell (Januar 2025). Es erzeugt in zwei Stufen hochauflösende 3D-Assets mit Texturen aus Text oder Bild und unterstützt Text-, Bild-, Skizzen- und Porträt-zu-3D. Die Gewichte sind auf Hugging Face frei verfügbar.
- Hyper3D Rodin 3D-Modelle
Hyper3D Rodin ist ein kommerzielles 3D-Generierungsmodell von Deemos. Die Generation 2.5 erzeugt aus Bild oder Text hochdetaillierte Geometrie mit ueber 10 Millionen Polygonen und 3D-nativen PBR-Texturen und gilt als fuehrend bei Photorealismus.
- Input-Token API-Nutzung LLM-Pricing
Tokens, die du beim API-Aufruf an ein KI-Modell sendest — dein Prompt, der Kontext, mitgegebene Dokumente. Werden separat von Output-Tokens und meist deutlich günstiger berechnet.
- Kimi K2 Moonshot AI
Kimi K2 ist die Open-Weight-MoE-Modellreihe von Moonshot AI mit 1 Billion Parametern und 32 Mrd. aktiven Parametern, trainiert auf 15,5 Billionen Tokens — Fokus auf Agenten- und Coding-Aufgaben.
- Kimi K2 Thinking Moonshot AI
Kimi K2 Thinking (November 2025) ist Moonshot AIs offenes Reasoning-Agenten-Modell — ein Billion-Parameter-MoE mit 256K Kontext, das lange Denk- und Tool-Use-Ketten eigenständig durchläuft.
- Kimi K2.5 Moonshot AI
Kimi K2.5 ist ein im Januar 2026 veröffentlichtes offenes KI-Modell von Moonshot AI. Es ist ein natives multimodales Mixture-of-Experts-Modell mit rund 1 Billion Parametern (32 Mrd. aktiv), 256.000 Tokens Kontext und agentischen Fähigkeiten.
- Kimi K2.6 Moonshot AI
Kimi K2.6 ist Moonshot AIs Open-Weight-Agent-Modell vom April 2026 — 1 Billion Parameter (32B aktiv), 262k-Kontext, nativ multimodal, mit Agent-Swarms aus bis zu 300 Subagenten.
- Kimi K3 Moonshot AI
Kimi K3 (Juli 2026) ist Moonshot AIs Flaggschiff mit offenen Gewichten — ein MoE-Modell mit 2,8 Bio. Parametern (104 Mrd. aktiv), nativer Vision und 1-Mio.-Token-Kontext.
- Kling 3.0 Bild & Video
Kling 3.0 ist das Video-Modell von Kuaishou, veröffentlicht am 5. Februar 2026. Es erzeugt bis zu 15 Sekunden lange, fotorealistische Clips mit nativem Ton in mehreren Sprachen und gilt als preis-leistungsstärkster Video-Generator.
- Kokoro Speech & Voice Open-Weight
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
- Llama 2 Llama
Llama 2 ist Metas offen gewichtetes Sprachmodell vom Juli 2023 — das erste Llama mit kommerziell nutzbarer Lizenz, in den Größen 7B, 13B und 70B mit 4K-Kontext.
- Llama 3 Llama
Am 18. April 2024 veröffentlichte offene Modellgeneration von Meta. Erschien zunächst in den Größen 8B und 70B (jeweils Basis- und Instruct-Variante) unter der Llama-3-Community-Lizenz; frei herunterladbar, für Forschung und kommerzielle Nutzung.
- Llama 3.1 Llama
Llama 3.1 (Juli 2024) ist Metas Open-Weight-Familie in 8B, 70B und 405B mit 128K-Kontext und Mehrsprachigkeit — das 405B war das erste offene Modell auf Augenhoehe mit GPT-4o und Claude 3.5 Sonnet.
- Llama 3.2 Llama
Llama 3.2 ist Metas Modellgeneration vom September 2024 — erstmals mit Vision-Unterstützung (11B/90B) und schlanken Edge-Modellen (1B/3B) für Mobil- und On-Device-Einsatz.
- Llama 3.3 Llama
Llama 3.3 (Dezember 2024) ist Metas offenes 70B-Instruct-Modell — es erreicht 405B-Klasse-Qualitaet bei 70B-Kosten, mit 128K-Kontext und offenen Gewichten.
- Llama 4 Maverick Llama
Llama 4 Maverick (April 2025) ist Metas große Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 400 Mrd. Parametern auf 128 Experten, 1-Mio.-Tokens-Kontext.
- Llama 4 Scout Llama
Llama 4 Scout (April 2025) ist Metas kleine Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 109 Mrd. Parametern, 10-Mio.-Tokens-Kontext, multimodal.
- Llama-3-SauerkrautLM-70b Llama
Llama-3-SauerkrautLM-70b ist ein deutschsprachig DPO-feingetuntes 70B-Modell auf Basis von Meta Llama 3, entwickelt von VAGOsolutions und Hyperspace.ai.
- Magistral Mistral
Magistral ist Mistral AIs erstes Reasoning-Modell vom Juni 2025 — mit transparenter, nachvollziehbarer Argumentationskette und Stärke in europäischen Sprachen, teils als offene Gewichte.
- Meshy 3D-Modelle
Meshy ist eine kommerzielle Hosted-Plattform fuer 3D-Generierung aus Text oder Bild. Version 6 erzeugt in etwa einer Minute produktionsreife Assets mit PBR-Texturen, Auto-Retopology und Rigging und gilt als vielseitiges Allround-Werkzeug.
- Microsoft TRELLIS.2 3D-Modelle Open-Weight
Microsoft TRELLIS.2 ist das staerkste offene Bild-zu-3D-Modell (4 Mrd. Parameter, MIT-Lizenz). Es erzeugt in Sekunden hochaufloesende Assets mit nativen PBR-Materialien und unterstuetzt Gaussian Splatting; Gewichte sind auf Hugging Face frei verfuegbar.
- Midjourney v8 Bild & Video
Midjourney v8 ist die achte Generation des Bildgenerators von Midjourney (Alpha März 2026) mit rund fünffach schnellerer Erzeugung, nativer 2K-Auflösung und verbesserter Textwiedergabe.
- MiniMax MiniMax
MiniMax ist ein 2021 in Shanghai gegründetes KI-Labor, dessen offene M-Modellfamilie (LLMs) auf sehr lange Kontextfenster und niedrige Betriebskosten durch Sparse Attention setzt.
- Mistral 7B Mistral
Mistral 7B (September 2023) ist das erste Open-Weight-Modell von Mistral AI — ein 7,3B-Parameter-Modell unter Apache 2.0, das damals das groessere Llama 2 13B in Benchmarks uebertraf.
- Mistral Large 3 Mistral
Mistral Large 3 (Dezember 2025) ist Mistrals offenes MoE-Flaggschiff — 675 Mrd. Parameter, 256K-Tokens-Kontext, nativ multimodal, Apache 2.0.
- Mistral Medium 3 Mistral
Mistral Medium 3 ist ein im Mai 2025 veröffentlichtes proprietäres KI-Modell von Mistral AI. Es ist als Enterprise-Modell auf hohe Leistung bei niedrigen Betriebskosten ausgelegt, bietet rund 128.000 Tokens Kontext und ist auch on-premise oder in der eigenen VPC betreibbar.
- Mistral Small 4 Mistral
Mistral Small 4 ist Mistral AIs Open-Weight-MoE-Modell vom März 2026 — vereint Reasoning, Vision und Coding in einem Modell, 119B Parameter (6,5B aktiv), Apache 2.0.
- Mixtral 8x7B Mistral
Mixtral 8x7B (Dezember 2023) ist Mistral AIs offenes Sparse-MoE-Modell mit 8 Experten — 46,7 Mrd. Parameter, 12,9 Mrd. aktiv pro Token, 32K-Kontext, Apache-2.0-Lizenz.
- Muse Spark Muse
Muse Spark ist Metas closed-weight-Flaggschiff vom April 2026 — das erste Modell der Muse-Linie aus den Meta Superintelligence Labs, mit Fokus auf effizientes Reasoning per Thought Compression.
- NVIDIA Canary Speech & Voice Open-Weight
Canary ist NVIDIAs offene ASR- und Speech-Translation-Modellfamilie (CC-BY-4.0), die auf dem Open-ASR-Leaderboard bei englischer Genauigkeit vor OpenAI Whisper liegt und 25 europaeische Sprachen abdeckt.
- Opus 4.6 Claude
Claude Opus 4.6 ist Anthropics Flaggschiff-Modell vom Februar 2026 — Top-Tier der Claude-4-Familie mit 1-Mio.-Tokens-Kontext, gestärktem Coding und neuen Effort-Controls.
- Opus 4.7 Claude
Claude Opus 4.7 ist Anthropics Top-Tier-Modell vom April 2026 — Nachfolger von Opus 4.6 mit hochauflösender Bildverarbeitung, neuem xhigh-Effort-Level und Task-Budgets für lange agentische Läufe.
- Output-Token API-Nutzung LLM-Pricing
Tokens, die ein KI-Modell als Antwort erzeugt. Werden separat berechnet und sind meist drei- bis fünfmal teurer als Input-Tokens, weil das Modell sie aktiv generieren muss.
- Pixtral Mistral
Erstes multimodales Modell von Mistral AI, im September 2024 unter Apache 2.0 veröffentlicht. Vision-Sprachmodell mit 12 Mrd. Parametern plus 400-Mio.-Vision-Encoder, verarbeitet Text und (mehrere) Bilder; 128K-Kontext, offene Gewichte über Hugging Face.
- Prompt Caching API-Nutzung LLM-Pricing
Prompt Caching ist eine API-Funktion, bei der ein Anbieter wiederkehrende Prompt-Bestandteile zwischenspeichert — Folgeanfragen werden dadurch günstiger und schneller, weil der gecachte Teil nicht erneut verarbeitet wird.
- Qwen 2.5 Qwen
Im September 2024 veröffentlichte offene Modellfamilie von Alibaba. Umfasst Basisgrößen von 0,5B bis 72B Parametern plus Coder- und Math-Varianten; 128K-Kontext, mehrsprachig. Kleinere Größen unter Apache 2.0, das 72B-Modell unter eigener Qwen-Lizenz.
- Qwen 3 Qwen
Qwen 3 ist die im April 2025 veröffentlichte Familie offener KI-Modelle von Alibaba. Sie reicht von 0,6B bis 235B Parametern (dichte und MoE-Modelle), steht unter Apache-2.0-Lizenz und vereint einen Thinking- und einen Non-Thinking-Modus in einem Modell.
- Qwen 3.5 Qwen
Qwen 3.5 (Februar 2026) ist Alibabas offene Modellfamilie der dritten Generation — von 0,8B bis 397B Parameter, MoE-Flaggschiff mit 1-Mio.-Tokens-Kontext, multimodal.
- Qwen 3.6 Qwen
Qwen 3.6 ist Alibabas Open-Weights-Modell vom April 2026 — die dichte 27B-Variante erreicht auf agentischen Coding-Benchmarks das Niveau deutlich größerer MoE-Modelle, unter Apache-2.0-Lizenz.
- Qwen 3.7-Max Qwen
Qwen 3.7-Max (Mai 2026) ist Alibabas proprietaeres Max-Flaggschiff mit 1-Mio.-Tokens-Kontext, positioniert als „Agent Frontier" fuer lange, tool-intensive Agenten-Workflows.
- Qwen 3.8-Max Qwen
Qwen 3.8-Max (August 2026) ist Alibabas groesstes Flaggschiff — ein MoE-Modell mit 2,4 Bio. Parametern, 1-Mio.-Token-Kontext und multimodalem Input, spaeter mit offenen Gewichten.
- Qwen3-Max Qwen
Qwen3-Max ist Alibabas Billion-Parameter-Flaggschiff vom September 2025 — ein Mixture-of-Experts-Modell mit 262K Kontext, das anders als frühere Qwen-Modelle nur über API zugänglich ist.
- Rate Limit (KI) API-Nutzung LLM-Pricing
Vom API-Anbieter durchgesetzte Obergrenze für Anfragen oder Tokens pro Zeitfenster — schützt die Infrastruktur und sichert faire Nutzung über alle Kunden hinweg.
- Runway Gen-4.5 Bild & Video
Runway Gen-4.5 ist das Video-Modell von Runway, das aus Text oder Bild 5- und 10-Sekunden-Clips mit starker Prompt-Treue und cineastischer Bewegung erzeugt. Es entstand mit NVIDIA und nutzt eine Autoregressive-to-Diffusion-Technik.
- SauerkrautLM Open-Weight
SauerkrautLM ist eine deutschsprachige LLM-Familie des deutschen Startups VAGOsolutions — Feintunings auf Basis von Llama, Qwen, Mistral und anderen offenen Architekturen.
- Sec-Gemini v1 Security-Modelle
Sec-Gemini v1 ist Googles experimentelles, auf Gemini basierendes KI-Modell fuer Cybersecurity. Es kombiniert Gemini-Reasoning mit aktueller Threat Intelligence aus Mandiant, der OSV-Schwachstellendatenbank und Google Threat Intelligence.
- Seedream 4.0 Bild & Video
Seedream 4.0 ist ByteDances multimodales Bildmodell (September 2025), das Text und mehrere Bilder als Eingabe verarbeitet, bis zu 4K rendert und über zehnmal schneller ist als Seedream 3.0.
- Tier-Pricing API-Nutzung LLM-Pricing
Mehrstufiges Modell-Angebot eines Anbieters — kleine, schnelle Varianten (Mini/Flash/Haiku) zum Bruchteil des Preises der großen Frontier-Modelle. Auch: Volume-Tiers mit Mengenrabatt.
- Tripo AI 3D-Modelle
Tripo AI ist eine kommerzielle 3D-Generierungsplattform von VAST AI. Version 3.1 fuehrt 2026 die ELO-Arena-Rankings an und liefert aus Text oder Bild game-ready Modelle mit sauberer Quad-Topologie, PBR-Texturen und Auto-Rigging.
- Veo 3.1 Bild & Video
Veo 3.1 ist Googles Video-Modell (DeepMind), das aus Text oder Bild 8-Sekunden-Clips mit nativ synchronisiertem Ton erzeugt. Seit dem Update im Januar 2026 liefert es echtes 4K (3840x2160) sowie vertikale Formate.
- Whisper LLM-Grundlagen Speech & Voice
Whisper ist OpenAIs offenes Speech-to-Text-Modell von 2022 — ein mehrsprachiger Encoder-Decoder-Transformer, der Audio in Text umwandelt und in mehreren Größen unter MIT-Lizenz verfügbar ist.