Glossar
boostN-App-Glossar: KI-, App- und Workflow-Begriffe knapp erklärt.
274 Einträge in 24 Buchstaben.
A
11 Begriffe- Accelerate Hugging Face
Accelerate ist eine quelloffene Bibliothek von Hugging Face, die PyTorch-Trainingscode mit minimalen Änderungen auf beliebiger Hardware und in verteilten Setups lauffähig macht — inklusive Mixed Precision sowie FSDP- und DeepSpeed-Unterstützung.
- Adapter (PEFT) Training & Fine-Tuning
Ein Adapter ist ein kleines, neu hinzugefügtes Netzwerk-Modul, das in ein eingefrorenes Sprachmodell injiziert wird — nur diese Module werden trainiert, das Basis-Modell selbst bleibt unverändert.
- Agentic RAG RAG
Agentic RAG ist eine RAG-Architektur, in der ein Agent das Retrieval steuert — er zerlegt Fragen, sucht iterativ, prüft Treffer und entscheidet selbst, ob ein zweiter oder dritter Durchgang nötig ist.
- Aider Coding-CLI
Aider ist ein quelloffener KI-Pair-Programmer für die Kommandozeile, der Code direkt im Git-Repository editiert und jede Änderung automatisch committet.
- AssemblyAI Universal-2 Speech & Voice
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
- Attention-Mechanismus LLM-Grundlagen
Rechenverfahren in Transformer-Modellen, das gewichtet, welche Teile des Eingabetextes für die Vorhersage des nächsten Tokens am relevantesten sind — statt jeden Teil gleich stark zu berücksichtigen.
- Audio-Normalisierung LLM-Grundlagen
Audio-Normalisierung ist die adaptive lineare Skalierung eines Audio-Signals auf einen Zielpegel — das Tool misst zuerst einen Bezugswert (Peak, RMS oder LUFS) und berechnet daraus den nötigen Gain.
- Auto-Classifier Coding-CLI Sicherheit & Berechtigungen
Ein Sicherheits-Layer in Claude Code: ein kleines LLM bewertet jeden nicht explizit erlaubten Tool-Call live auf Risiko und blockt destruktive oder nicht-autorisierte Aktionen.
- AutoGen Agenten-Frameworks
AutoGen ist ein quelloffenes Framework von Microsoft zum Bauen von Multi-Agenten-Anwendungen mit LLMs. Mehrere KI-Agenten lösen Aufgaben gemeinsam in strukturierten Konversationen, etwa im Gruppenchat oder über asynchronen Nachrichtenaustausch.
- AutoGPT Agenten
AutoGPT ist ein 2023 veröffentlichtes Open-Source-Experiment, das ein Sprachmodell wie GPT-4 in einer autonomen Schleife laufen lässt — es zerlegt ein Ziel selbst in Teilaufgaben, ruft Werkzeuge auf und arbeitet sie mit minimalem menschlichem Eingriff ab.
- Automatic Speech Recognition (ASR) LLM-Grundlagen
Automatic Speech Recognition (ASR), auch Speech-to-Text (STT) genannt, bezeichnet die automatische Umwandlung gesprochener Sprache in geschriebenen Text durch ein akustisches Modell.
B
4 Begriffe- Batch-API API-Nutzung LLM-Pricing
Asynchroner API-Modus, bei dem viele Anfragen gesammelt und mit deutlichem Preisrabatt verarbeitet werden — Ergebnisse liegen meist innerhalb von 24 Stunden vor.
- Batch-Inferenz Lokales LLM
Batch-Inferenz bezeichnet das gebündelte Verarbeiten vieler Prompts in einem Durchlauf — entweder lokal über die GPU oder als asynchroner API-Job — zugunsten von Durchsatz und Kosten statt Echtzeit-Latenz.
- Benchmark (KI) Evaluation
Ein KI-Benchmark ist ein standardisierter Aufgaben-Datensatz, der Sprachmodelle vergleichbar macht — gleiche Fragen, gleiches Scoring, transparente Ergebnisse für Reasoning, Wissen oder Coding.
- Browser Use Agenten
Browser Use bezeichnet KI-Agenten, die einen echten Webbrowser steuern — navigieren, klicken, Formulare ausfüllen, Inhalte auslesen — um Aufgaben im Web autonom zu erledigen. Der Browser ist dabei Werkzeug und Wahrnehmungsfläche zugleich.
C
33 Begriffe- Catastrophic Forgetting Training & Fine-Tuning
Catastrophic Forgetting bezeichnet den Effekt, dass ein neuronales Netz beim Training auf neuen Daten zuvor erlerntes Wissen ganz oder teilweise verliert — ein zentrales Problem beim Fine-Tuning von Sprachmodellen.
- Chain-of-Thought Prompting
Chain-of-Thought (CoT) ist eine Prompting-Technik, bei der das Modell aufgefordert wird, seinen Lösungsweg in Zwischenschritten auszuformulieren — das verbessert die Trefferquote bei Aufgaben mit mehreren Denkschritten.
- Chatterbox Speech & Voice Open-Weight
Chatterbox ist ein quelloffenes Text-to-Speech-Modell von Resemble AI unter MIT-Lizenz. In Blindtests bevorzugten Hoerer es mehrheitlich gegenueber ElevenLabs; es bietet Emotionssteuerung, Voice-Cloning und niedrige Latenz.
- Chroma Vektor-Datenbanken
Chroma (ChromaDB) ist eine quelloffene Vektordatenbank zum Speichern und Durchsuchen von Embeddings. Sie wird vor allem in RAG-Systemen genutzt, um relevante Textpassagen per Ähnlichkeitssuche an Sprachmodelle zu liefern.
- Chunking RAG
Chunking ist das Zerlegen längerer Texte in kleinere, eigenständig sinnvolle Abschnitte — der erste Schritt jeder RAG-Pipeline, weil Embeddings und Retrieval auf Stück-Ebene arbeiten.
- Claude Code AI-IDE Coding-CLI
Claude Code ist Anthropics offizielles KI-Coding-Tool — verfügbar als Terminal-CLI, VS-Code-Extension, JetBrains-Plugin und Web-App, mit starkem Fokus auf Tool-Use und konfigurierbare Workflows.
- Claude Fable 5 Claude
Claude Fable 5 ist Anthropics erstes öffentlich verfügbares Modell der Mythos-Klasse, veröffentlicht im Juni 2026. Es ist auf anspruchsvollstes Schlussfolgern und langlaufende agentische Arbeit ausgelegt und bietet ein 1-Million-Token-Kontextfenster.
- Claude Fable 5.1 Claude
Am 1. September 2026 veröffentlichtes Spitzenmodell der Claude-Fable-Linie von Anthropic. Frontier-Modell für anspruchsvolles Reasoning, Coding, Recherche und lange Agenten-Läufe; 1M-Token-Kontext, multimodale Eingabe, proprietärer Zugang über API und Claude-Apps.
- Claude Haiku 4.5 Claude
Claude Haiku 4.5 ist Anthropics schnelles Kompaktmodell vom Oktober 2025 — bringt Sonnet-4-nahe Leistung bei rund einem Drittel der Kosten und ist das erste Haiku-Modell mit Reasoning.
- Claude Mythos Claude
Claude Mythos (April 2026) ist Anthropics bisher leistungsstärkstes Modell — ein neuer Tier oberhalb der Opus-Reihe, primär verteilt über das Glasswing-Programm an Cybersecurity-Defender.
- Claude Mythos 5 Claude
Claude Mythos 5 (9. Juni 2026) ist Anthropics leistungsstärkste Modell-Linie oberhalb von Opus — technisch identisch mit Fable 5, aber ohne dessen Sicherheits-Klassifikatoren, verteilt über Project Glasswing.
- Claude Mythos 5.1 Claude
Claude Mythos 5.1 (September 2026) ist Anthropics Frontier-Modell fuer geprüfte Cyber- und Life-Science-Organisationen — dasselbe Modell wie Fable 5.1, nur mit freizuegigeren Safeguards.
- Claude Opus 4.5 Claude
Claude Opus 4.5 ist Anthropics Top-Tier-Modell vom November 2025 — der direkte Vorgänger von Opus 4.6, bringt „Infinite Chats" und deutlich reduzierten Token-Verbrauch.
- Claude Opus 4.8 Claude
Claude Opus 4.8 ist das im Mai 2026 veröffentlichte Spitzenmodell der Opus-Linie von Anthropic. Es zielt auf agentisches Programmieren, komplexes Schlussfolgern und Computer-Nutzung und gilt als schrittweise, aber messbare Verbesserung gegenüber Opus 4.7.
- Claude Opus 5 Claude
Am 24. Juli 2026 veröffentlichtes Spitzenmodell der Claude-Opus-Linie von Anthropic. Positioniert als leistungsstarkes Alltagsmodell für Wissensarbeit, Coding und Agenten; Zugang proprietär über Claude-App und API (Modell-ID claude-opus-5).
- Claude Sonnet 4.5 Claude
Claude Sonnet 4.5 (September 2025) ist Anthropics auf Agenten und Coding optimiertes Modell der Sonnet-Linie — bei Erscheinen fuehrend auf SWE-bench Verified, inzwischen von neueren Sonnet-Versionen abgeloest.
- Claude Sonnet 4.6 Claude
Claude Sonnet 4.6 ist Anthropics mittleres Modell vom Februar 2026 — nahe an Opus-Niveau, mit 1-Mio.-Token-Kontext und unveraendertem Sonnet-Preis von 3/15 USD pro Mio. Token.
- Claude Sonnet 5 Claude
Claude Sonnet 5 ist Anthropics Mittelklasse-Modell vom 30. Juni 2026 — das bislang agentischste Sonnet, mit Leistung nahe Opus 4.8 bei 2 USD Input und 10 USD Output je 1 Mio. Tokens.
- Claude Sonnet 5.5 Claude
Claude Sonnet 5.5 (28. September 2026) ist Anthropics günstiges Mittelklasse-Modell — eine schnellere, preiswertere Ergänzung zu Opus 5.5, mit 2/10 $ je 1 Mio. Token und dem Spitzenwert bei Terminal-Bench 4.0. Über boostN nutzbar.
- Code Llama Llama
Code Llama ist Metas auf Programmierung spezialisierte Llama-2-Variante vom August 2023 — offen gewichtet, in mehreren Größen und mit Basis-, Python- und Instruct-Ausprägungen.
- Codestral Mistral
Codestral ist Mistral AIs auf Code spezialisiertes Modell (erstmals Mai 2024) — ein 22-Mrd.-Parameter-Modell für Code-Vervollständigung und -Generierung, ursprünglich als offene Gewichte veröffentlicht.
- Computer Use Agenten
Computer Use ist eine Fähigkeit moderner KI-Modelle, einen Computer wie ein Mensch zu bedienen — Bildschirm sehen, Maus bewegen, Tastatur nutzen — um Aufgaben in beliebigen Anwendungen ohne API auszuführen.
- Constitutional AI Prompting
Constitutional AI ist ein von Anthropic entwickeltes Trainingsverfahren, bei dem ein KI-Modell sein eigenes Verhalten anhand einer expliziten Liste von Prinzipien (einer „Verfassung") kritisiert und überarbeitet — statt allein über menschliche Bewertungen.
- Context Engineering Prompting
Context Engineering ist die Disziplin, alle Inhalte des LLM-Kontextfensters — System-Prompt, Tool-Definitionen, RAG-Treffer, Memory, Konversationshistorie — bewusst zu kuratieren und über die Zeit zu pflegen.
- Context Precision Evaluation
Context Precision ist eine RAG-Eval-Metrik (0–1), die misst, wie gut der Retriever relevante Kontexte vor irrelevante platziert — Fokus liegt auf Ranking-Qualität, nicht auf reiner Trefferanzahl.
- Context Recall Evaluation
Context Recall ist eine RAG-Eval-Metrik (0–1), die misst, wie vollständig der Retriever die für die Goldantwort nötigen Fakten geliefert hat — fehlt ein Fakt im Kontext, sinkt der Score.
- Contextual Retrieval RAG
Contextual Retrieval ist eine RAG-Technik von Anthropic, die jedem Chunk vor dem Indexieren einen vom LLM generierten Kontext-Satz voranstellt — und so die Trefferqualität deutlich erhöht.
- Continue.dev AI-IDE
Continue.dev ist eine quelloffene, modell-agnostische KI-Coding-Extension für VS Code und JetBrains — Konfiguration via YAML, funktioniert mit kommerziellen wie lokalen Modellen.
- Continued Pretraining Training & Fine-Tuning
Continued Pretraining ist das Weitertrainieren eines bereits vortrainierten Sprachmodells auf großen Mengen Domänen-Text — bevor klassisches Fine-Tuning beginnt.
- Conversational Marketing Strategie
Conversational Marketing ist eine dialogbasierte Form der Kundenansprache, die über Chat, Messaging und KI-Chatbots in Echtzeit auf Interessenten eingeht. Ziel ist es, Nutzende entlang der Customer Journey im Gespräch zu begleiten statt über starre Formulare.
- Cosine Similarity RAG
Cosine Similarity misst die Ähnlichkeit zweier Vektoren über den Winkel zwischen ihnen — Standardmaß im RAG-Retrieval, um Embeddings einer Anfrage mit Embeddings im Vektor-Index zu vergleichen.
- CrewAI Agenten-Frameworks
CrewAI ist ein quelloffenes Framework zur Orchestrierung mehrerer autonomer KI-Agenten. Es weist Agenten Rollen, Ziele und Werkzeuge zu und lässt sie in Teams ("Crews") zusammenarbeiten, um komplexe Aufgaben in koordinierten, mehrstufigen Abläufen zu lösen.
- Cursor AI-IDE
Cursor ist ein KI-erster Code-Editor — ein Fork von Visual Studio Code mit tief in den Editor integrierter KI-Unterstützung.
D
16 Begriffe- Datasets (HF) Hugging Face
Datasets ist eine Open-Source-Python-Bibliothek von Hugging Face zum Laden, Verarbeiten und Teilen von Datensätzen für maschinelles Lernen. Sie nutzt Apache Arrow und Memory-Mapping, um auch sehr große Datenmengen effizient zu handhaben.
- dBFS, Headroom & Clipping LLM-Grundlagen
Drei zusammenhängende Begriffe für digitale Audio-Pegel: dBFS ist die Skala mit 0 dBFS als absoluter Obergrenze, Headroom der Sicherheitsabstand zum Maximum, Clipping das harte Abschneiden bei Überschreitung.
- Deepgram Nova-3 Speech & Voice
Nova-3 ist Deepgrams Echtzeit-Speech-to-Text-Modell (Release Februar 2025) mit sehr niedriger Streaming-Latenz von rund 200 bis 300 Millisekunden, Keyterm-Prompting und Unterstuetzung fuer ueber 30 Sprachen.
- DeepSeek Janus-Pro-7B DeepSeek
Janus-Pro-7B ist DeepSeeks Open-Source-Multimodal-Modell vom Januar 2025 — vereint Bildverstehen und Bildgenerierung in einer einzigen 7B-Architektur, MIT-lizenziert.
- DeepSeek R1 DeepSeek
Am 20. Januar 2025 unter MIT-Lizenz veröffentlichtes offenes Reasoning-Modell des chinesischen Labors DeepSeek. Mixture-of-Experts mit 671 Mrd. Parametern (37 Mrd. pro Token aktiv), stark über Reinforcement Learning trainiert; erreichte als erstes offenes Modell OpenAIs o1-Niveau.
- DeepSeek V3 DeepSeek
DeepSeek V3 ist ein im Dezember 2024 veröffentlichtes offenes KI-Modell des chinesischen Anbieters DeepSeek. Es nutzt eine Mixture-of-Experts-Architektur mit 671 Milliarden Parametern (37 Mrd. aktiv je Token) und rund 128.000 Tokens Kontext.
- DeepSeek V3.1 DeepSeek
DeepSeek V3.1 ist das Open-Weights-Hybridmodell von DeepSeek vom August 2025 — vereint Think- und Non-Think-Modus in einem Modell, mit 128K-Kontext und starken Agenten-Fähigkeiten.
- DeepSeek V3.2 DeepSeek
DeepSeek V3.2 (1. Dezember 2025) ist ein offenes MoE-Modell mit 685 Mrd. Parametern unter MIT-Lizenz — dank DeepSeek Sparse Attention besonders effizient bei langen Kontexten.
- DeepSeek V4 DeepSeek
DeepSeek V4 (April 2026) ist die vierte Generation des chinesischen Open-Weight-MoE-Modells — als Pro (1,6 T Parameter) und Flash (284 B) unter MIT-Lizenz veröffentlicht, mit 1-Mio.-Tokens-Kontext.
- DeepSeek V4-Flash DeepSeek
DeepSeek V4-Flash (Juli 2026) ist ein offenes MoE-Modell mit 284 Mrd. Parametern (13 Mrd. aktiv), 1-Mio.-Token-Kontext und MIT-Lizenz — frei ladbar auf Hugging Face.
- DeepSeek V4-Pro DeepSeek
DeepSeek V4-Pro (2026) ist das Open-Weight-Flaggschiff von DeepSeek — ein 1,6-Billionen-Parameter-MoE mit rund 49B aktiven Parametern pro Token, 1-Mio.-Tokens-Kontext und MIT-Lizenz.
- DeepSeek V4.1-Flash DeepSeek
DeepSeek V4.1-Flash (10. September 2026) ist das kleinste Modell der neuen DeepSeek-V4.1-Architektur — erste DeepSeek-Familie mit nativer multimodaler Bildverarbeitung. Speed-/kosten-optimiertes „Flash"-Modell mit offenen Gewichten (MIT), über boostN nutzbar.
- Devstral Mistral
Devstral ist Mistral AIs offenes Agenten-Modell für Software-Engineering (Mai 2025) — trainiert darauf, echte GitHub-Issues zu lösen, und stark auf SWE-bench Verified.
- Diffusers Hugging Face
Diffusers ist eine quelloffene Python-Bibliothek von Hugging Face zum Nutzen und Trainieren von Diffusionsmodellen für die Bild-, Video- und Audiogenerierung. Sie baut auf PyTorch auf und gliedert sich in Pipelines, Modelle und Scheduler.
- DPO (Direct Preference Optimization) Training & Fine-Tuning
DPO ist ein Fine-Tuning-Verfahren, das Sprachmodelle direkt an menschlichen Präferenzpaaren ausrichtet — ohne separates Reward-Modell und ohne Reinforcement Learning.
- DSPy Pipeline-Frameworks
DSPy ist ein quelloffenes Python-Framework der Stanford NLP Group, das LLM-Anwendungen programmieren statt manuell prompten lässt. Aufgaben werden über deklarative Signaturen und Module beschrieben; Optimizer erzeugen daraus automatisch wirksame Prompts und Beispiele.
E
4 Begriffe- ElevenLabs v3 Speech & Voice
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
- Embedding LLM-Grundlagen
Ein Embedding ist eine Zahlenrepräsentation (Vektor) von Text, Bild oder anderen Daten, in der semantisch ähnliche Inhalte räumlich nah beieinander liegen.
- Ensemble / Multi-Modell-Orchestrierung Agenten
Ensemble bezeichnet das Kombinieren mehrerer bewusst variierter LLM-Läufe oder Modelle, deren Funde sich ergänzen. Multi-Modell-Orchestrierung steuert diese Läufe über Orchestratoren mit Sub-Agenten, sodass die Vereinigung der Ergebnisse größer ist als jeder Einzellauf.
- Evals Evaluation
Evals sind systematische Tests für LLM-Anwendungen — feste Testfälle, automatische Bewertung der Antworten, Ergebnis als Score. Grundlage, um Prompt- oder Modellwechsel objektiv zu vergleichen.
F
8 Begriffe- Faithfulness Evaluation
Faithfulness ist eine RAG-Eval-Metrik (0–1), die misst, wie viele Aussagen einer Antwort sich tatsächlich aus den abgerufenen Kontexten ableiten lassen — ein direkter Halluzinations-Indikator.
- Few-Shot Prompting Prompting
Few-Shot Prompting ist eine Technik, bei der dem Modell im Prompt einige Beispiele der gewünschten Input-Output-Paarung gezeigt werden, um Format und Stil der Antwort zu steuern.
- Fine-Tuning Training & Fine-Tuning
Nachtraining eines vortrainierten Modells auf einem kleineren, spezialisierten Datensatz, um Stil, Format oder Domänenwissen gezielt anzupassen.
- Fish Audio S2 Speech & Voice Open-Weight
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
- Flowise Pipeline-Frameworks
Flowise ist ein quelloffenes Low-Code-Werkzeug, mit dem sich LLM-Anwendungen und KI-Agenten visuell per Drag-and-drop zusammenbauen lassen. Es baut auf dem LangChain-Ökosystem auf und verbindet Modelle, Datenquellen und Werkzeuge als Knoten.
- FLUX.2 Bild & Video Open-Weight
FLUX.2 ist die Text-zu-Bild-Modellfamilie von Black Forest Labs. Sie umfasst die proprietaeren Varianten Pro und Flex sowie das offene 32-Mrd.-Parameter-Modell Dev und die kompakte Klein-Reihe, die Bilderzeugung und Bildbearbeitung in einem Modell vereinen.
- Foundation-Sec-8B Security-Modelle Open-Weight
Foundation-Sec-8B ist Cisco Foundation AIs offenes, auf Cyber-Security spezialisiertes Sprachmodell (2025). Es erweitert Llama-3.1-8B durch fortgesetztes Pretraining auf rund 5 Mrd. Security-Tokens und steht unter Apache-2.0-Lizenz frei zur Verfügung.
- Function Calling Agenten
Function Calling ist die Fähigkeit eines Sprachmodells, statt einer Textantwort einen strukturierten Funktionsaufruf zu erzeugen — die technische Grundlage für Tool-Use und KI-Agenten.
G
44 Begriffe- Gemini 3 Flash Gemini
Gemini 3 Flash ist Googles schnelles, günstiges Thinking-Modell vom 17. Dezember 2025 — Pro-nahe Reasoning-Leistung bei 1 Mio. Token Kontext, ausgelegt auf agentische Workflows und Coding.
- Gemini 3 Pro Gemini
Gemini 3 Pro (November 2025) ist Googles drittes Flaggschiff-Modell mit 1-Mio.-Tokens-Kontextfenster und nativer Multimodalität — inzwischen abgelöst von Gemini 3.1 Pro.
- Gemini 3.1 Pro Gemini
Gemini 3.1 Pro (Februar 2026) ist Googles aktuelles Top-Modell — 1-Mio.-Tokens-Kontext, 64K Output-Tokens, verdoppelte Reasoning-Leistung gegenüber Gemini 3 Pro.
- Gemini 3.5 Flash Gemini
Gemini 3.5 Flash ist Googles hocheffizientes Multimodal-Modell vom Mai 2026 — bringt Pro-nahe Coding- und Reasoning-Qualität zu Flash-typischen Kosten und Geschwindigkeit.
- Gemini 3.6 Flash Gemini
Gemini 3.6 Flash (Juli 2026) ist Googles schnelle, kostenguenstige Flash-Stufe mit 1-Mio.-Tokens-Kontext — auf hohen Durchsatz und niedrige Kosten pro Anfrage ausgelegt.
- Gemini 3.7 Flash Gemini
Gemini 3.7 Flash (August 2026) ist Googles schnelles Workhorse-Modell fuer Coding und Agenten — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, halb so teuer wie 3.6 Flash.
- Gemini 3.8 Flash Gemini
Gemini 3.8 Flash (September 2026) ist Googles intelligentestes Workhorse-Modell fuer Coding, Agenten und mehrstufiges Reasoning — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, direkter Nachfolger von 3.7 Flash.
- Gemma 3 Gemma
Gemma 3 ist die im März 2025 veröffentlichte Familie offener KI-Modelle von Google. Sie umfasst vier Größen (1B, 4B, 12B, 27B), ist ab 4B multimodal, unterstützt über 140 Sprachen und bietet bis zu 128.000 Tokens Kontext.
- Gemma 3n Gemma
Offenes, mobil-first ausgelegtes KI-Modell von Google, als Preview im Mai 2025 und voll ab 26. Juni 2025 verfügbar. Multimodal (Text, Bild, Audio, Video), auf Geräte-Betrieb optimiert; offene Gewichte in den Größen E2B und E4B.
- Gemma 4 Gemma
Gemma 4 ist Google DeepMinds offene Modellfamilie vom April 2026 — vier Größen (E2B bis 31B), 256k-Kontext, Multimodalität, Apache-2.0-Lizenz.
- GGUF Lokales LLM
GGUF (GPT-Generated Unified Format) ist das Standard-Dateiformat für quantisierte LLMs auf der llama.cpp-Engine — eine `.gguf`-Datei enthält Gewichte, Tokenizer und Metadaten in einem.
- GitHub Copilot AI-IDE
GitHub Copilot ist der KI-Coding-Assistent von GitHub — als Extension für gängige Editoren mit Tab-Autocomplete, Chat und Multi-File-Edits, mit GPT- und Claude-Modellen wählbar.
- GLM-4.5 Zhipu AI
GLM-4.5 ist ein im Juli 2025 veröffentlichtes offenes KI-Modell von Zhipu AI (Z.ai). Es ist ein agent-natives Mixture-of-Experts-Modell mit 355 Milliarden Parametern (32 Mrd. aktiv), 128.000 Tokens Kontext und MIT-Lizenz.
- GLM-4.6 Zhipu AI
GLM-4.6 ist Zhipu AIs Open-Weight-MoE-Modell vom September 2025 — 355 Mrd. Parameter (32B aktiv), 200k-Kontext, MIT-lizenziert, mit Schwerpunkt auf Coding-Performance.
- GLM-4.7 Zhipu AI
GLM-4.7 (Dezember 2025) ist Zhipu AIs offenes Coding-Flaggschiff — ein MoE-Modell mit rund 400 Mrd. Parametern, 200K-Input-Kontext und dem Feature „Preserved Thinking".
- GLM-5 Zhipu AI
Im Februar 2026 unter MIT-Lizenz veröffentlichtes offenes Modell von Zhipu AI (Z.AI). Mixture-of-Experts mit rund 744 Mrd. Parametern (ca. 40 Mrd. pro Token aktiv), 200K-Kontext, Fokus auf Coding und Agenten. Frei herunterladbar über Hugging Face.
- GLM-5.1 Zhipu AI
GLM-5.1 ist Z.ais Open-Source-Flaggschiff vom April 2026 — 744 Mrd. Parameter (40B aktiv), 200k-Kontext, ausgelegt auf agentisches Coding mit bis zu 8 Stunden autonomer Laufzeit.
- GLM-5.2 Zhipu AI
GLM-5.2 (Juni 2026) ist das Open-Weight-Modell von Zhipu AI (Z.ai) — ein MoE mit rund 744B Parametern (~40B aktiv), 1-Mio.-Tokens-Kontext und MIT-Lizenz, stark bei agentischem Coding.
- GLM-5.3 Zhipu AI
GLM-5.3 ist Zhipu AIs Open-Weights-Modell vom August 2026 — ein MoE-Modell mit Fokus auf Coding und Cybersecurity, das bei agentischen Benchmarks die Spitze der offenen Modelle erreicht.
- Google Imagen Bild & Video
Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 erschien 2025 in den Stufen Fast, Generate und Ultra, ist ueber Gemini API und Vertex AI verfuegbar und bekannt fuer starke Typografie und Prompt-Treue.
- GPT Astra GPT Security-Modelle
GPT-6 Astra ist OpenAIs Flaggschiff vom September 2026 — erstes Modell auf der Preparedness-Stufe Critical, mit Schwerpunkt auf Computer-Use und Cybersecurity.
- GPT Image 2 Bild & Video
GPT Image 2 ist OpenAIs natives Bildmodell (April 2026), das vor dem Zeichnen schließt, sehr zuverlässig Text rendert und in hoher Auflösung fotorealistische Bilder erzeugt.
- GPT Luna GPT
GPT Luna (GPT-5.6 Luna) ist das kleinste, schnellste und günstigste Modell der im Juli 2026 veröffentlichten GPT-5.6-Familie von OpenAI. Es ist für kostensensible Massen-Workloads ausgelegt und bietet ein Kontextfenster von rund 1,05 Millionen Tokens.
- GPT Sol GPT
GPT-5.6 Sol ist OpenAIs Flaggschiff vom Juli 2026 — Spitzenmodell einer neuen Sonnensystem-Familie (Sol, Terra, Luna) mit Fokus auf Coding, Wissenschaft und Cybersecurity.
- GPT Terra GPT
GPT Terra ist die mittlere Stufe von OpenAIs GPT-5.6-Familie (Juli 2026) zwischen dem sparsamen Luna und dem Flaggschiff Sol — mit 1-Mio.-Tokens-Kontext auf ein starkes Preis-Leistungs-Verhaeltnis ausgelegt.
- GPT-4o GPT
GPT-4o (Mai 2024) war OpenAIs erstes nativ multimodales Modell — Text, Audio und Bild in einem einheitlichen Modell, mit Echtzeit-Sprachmodus und deutlich niedrigeren Kosten als GPT-4 Turbo.
- GPT-4o mini GPT
GPT-4o mini (Juli 2024) ist OpenAIs kleine, günstige Variante von GPT-4o — als Ablösung für GPT-3.5 Turbo positioniert, deutlich stärker bei spürbar niedrigerem Preis pro Token.
- GPT-5.2 GPT
GPT-5.2 ist OpenAIs Modell-Generation vom Dezember 2025 — drei Varianten (instant, thinking, Pro), 400k-Kontextfenster und neuer Stand der Technik bei beruflicher Wissensarbeit.
- GPT-5.3 GPT
GPT-5.3 ist eine Iteration der GPT-5-Reihe von OpenAI — die Instant-Variante kam am 3. März 2026 und fokussiert sich auf Faktentreue, kürzere Vorreden und natürlicheren Konversationsfluss.
- GPT-5.3-Codex GPT
GPT-5.3-Codex ist OpenAIs spezialisiertes agentisches Coding-Modell (Februar 2026), Nachfolger von GPT-5.2-Codex — 25 % schneller, mit deutlichen Sprüngen bei Terminal-Bench und OSWorld.
- GPT-5.3-Codex-Spark GPT
GPT-5.3-Codex-Spark ist OpenAIs Coding-Modell vom Februar 2026 — eine kleinere, real-time-optimierte Variante von GPT-5.3-Codex mit über 1000 Tokens pro Sekunde auf Cerebras-Hardware.
- GPT-5.4 GPT
GPT-5.4 ist OpenAIs Reasoning-Modell vom 5. März 2026 — erstes Mainline-Modell mit den Coding-Fähigkeiten von GPT-5.3-codex, nativer Computer-Use-Steuerung und 1-Mio.-Tokens-Kontext.
- GPT-5.5 GPT
GPT-5.5 ist OpenAIs Flaggschiff vom 23. April 2026 — positioniert als „smartestes und intuitivstes Modell" und gedacht als Schritt Richtung KI, die selbstständig durch Tools arbeitet.
- GPT-6.1 Sol GPT
GPT-6.1 Sol (29. September 2026) ist OpenAIs günstiges Coding- und Agenten-Modell — Nachfolger von GPT-6 Sol nach nur sieben Tagen, mit nahezu der Intelligenz von GPT-6 Astra zu rund einem Fünftel des Preises. Über boostN nutzbar.
- GPT-Live-1 GPT
Echtzeit-Sprachmodell von OpenAI, seit 8. Juli 2026 die Standard-Sprachfunktion in ChatGPT. Hört und spricht gleichzeitig (bidirektional), erlaubt Unterbrechungen und reicht komplexe Fragen an ein stärkeres Textmodell weiter. Proprietärer Zugang über ChatGPT.
- GPT4All Lokales LLM
GPT4All ist eine quelloffene Desktop-Anwendung von Nomic AI, mit der sich große Sprachmodelle lokal und offline auf dem eigenen Rechner ausführen lassen. Sie funktioniert ohne GPU und ohne Cloud-Anbindung, sodass Daten das Gerät nicht verlassen.
- GraphRAG RAG
GraphRAG ist eine RAG-Variante, die statt reiner Vektorsuche einen Knowledge Graph nutzt — Antworten kommen aus verknüpften Entitäten und Beziehungspfaden, nicht nur ähnlichem Text.
- Grok 3 Grok
Am 17. Februar 2025 veröffentlichtes Reasoning-Modell von xAI (Elon Musks KI-Firma). Trainiert auf dem Colossus-Supercluster, mit „Think"-Reasoning und DeepSearch sowie Echtzeit-Zugriff auf X. Proprietärer Zugang über die Grok-App und API.
- Grok 4 Grok
Grok 4 ist xAIs Reasoning-Modell vom Juli 2025 — Text- und Bild-Eingabe, 256k-Kontext, trainiert per Reinforcement Learning auf dem 200.000-GPU-Cluster Colossus.
- Grok 4.1 Grok
Grok 4.1 ist das im November 2025 veröffentlichte KI-Modell von xAI. Es liefert natürlichere Dialoge, weniger Halluzinationen und bessere Stilkontrolle und ist in zwei Varianten verfügbar: einer direkt antwortenden und einer vorab schlussfolgernden (Thinking).
- Grok 4.3 Grok
Grok 4.3 ist xAIs Reasoning-orientiertes Modell vom April 2026 — mit 1-Mio.-Token-Kontext, nativer Video-Eingabe und Fokus auf agentische Workflows und faktische Genauigkeit.
- Grok 4.5 Grok
Grok 4.5 ist xAIs Frontier-Modell vom Juli 2026 für Coding, agentische Aufgaben und Wissensarbeit — hohe Token-Effizienz bei 2 USD Input und 6 USD Output je 1 Mio. Tokens.
- Grok 4.6 Grok
Grok 4.6 (August 2026) ist xAIs Flaggschiff-Modell fuer langlaufende agentische Arbeit — 500k-Token-Kontext, Text- und Bild-Input, gestaffelter Preis ab 2/6 USD pro Mio. Token.
- Guardrails Prompting
Guardrails sind Schutzmechanismen rund um ein Sprachmodell, die Eingaben und Ausgaben prüfen, um unerwünschtes Verhalten — etwa Off-Topic-Antworten, PII-Lecks oder unsichere Aktionen — abzufangen.
H
8 Begriffe- Halluzination LLM-Grundlagen
Eine Halluzination ist eine Antwort eines Sprachmodells, die plausibel klingt, aber faktisch falsch oder erfunden ist — typische Quelle ist statistisches Raten ohne Faktenanker.
- Haystack Pipeline-Frameworks
Haystack ist ein quelloffenes KI-Orchestrierungs-Framework von deepset zum Bau produktionsreifer LLM-Anwendungen. Aus modularen Komponenten — Retriever, Generatoren, Router, Tools — werden explizite Pipelines für RAG, Agenten und semantische Suche zusammengesetzt.
- Hugging Face Hugging Face
Hugging Face ist die zentrale Plattform der Open-Source-KI-Community — Hub für Modelle, Datasets und Demos sowie Anbieter weit verbreiteter Bibliotheken wie Transformers, Diffusers und PEFT.
- Hugging Face Hub Hugging Face
Zentrale Plattform für offen geteilte KI-Modelle, Datensätze und Demos — eine Art GitHub für Machine-Learning-Artefakte.
- Hunyuan3D 2.0 3D-Modelle Open-Weight
Hunyuan3D 2.0 ist Tencents offenes generatives 3D-Modell (Januar 2025). Es erzeugt in zwei Stufen hochauflösende 3D-Assets mit Texturen aus Text oder Bild und unterstützt Text-, Bild-, Skizzen- und Porträt-zu-3D. Die Gewichte sind auf Hugging Face frei verfügbar.
- Hybrid Search RAG
Hybrid Search kombiniert lexikalische Volltext-Suche (z. B. BM25) mit semantischer Vektor-Suche und vereint die Stärken beider Verfahren — präzise auf Keywords und robust auf Bedeutung.
- HyDE RAG
HyDE (Hypothetical Document Embeddings) ist eine RAG-Technik, bei der ein LLM aus der Frage eine fiktive Antwort erzeugt — und dann mit deren Embedding nach echten Dokumenten sucht.
- Hyper3D Rodin 3D-Modelle
Hyper3D Rodin ist ein kommerzielles 3D-Generierungsmodell von Deemos. Die Generation 2.5 erzeugt aus Bild oder Text hochdetaillierte Geometrie mit ueber 10 Millionen Polygonen und 3D-nativen PBR-Texturen und gilt als fuehrend bei Photorealismus.
I
4 Begriffe- Indirect Prompt Injection Prompting
Indirect Prompt Injection ist ein Angriff, bei dem schädliche Anweisungen in externen Inhalten — Webseiten, Dokumenten, E-Mails — versteckt werden, die ein LLM verarbeitet und dabei unbeabsichtigt ausführt.
- Inferenz LLM-Grundlagen
Inferenz bezeichnet das Ausführen eines bereits trainierten Modells, um aus einer Eingabe eine Antwort zu generieren — also den produktiven Betrieb, nicht das Training.
- Input-Token API-Nutzung LLM-Pricing
Tokens, die du beim API-Aufruf an ein KI-Modell sendest — dein Prompt, der Kontext, mitgegebene Dokumente. Werden separat von Output-Tokens und meist deutlich günstiger berechnet.
- Instruction Tuning Training & Fine-Tuning
Instruction Tuning ist eine Variante des Supervised Fine-Tuning, bei der ein Sprachmodell auf einem breit gestreuten Mix aus Instruktion-Antwort-Paaren trainiert wird — damit es Anweisungen beliebiger Aufgaben verlässlich befolgt.
J
2 Begriffe- Jailbreak Prompting
Jailbreak bezeichnet das gezielte Umgehen der Sicherheits- und Verhaltensregeln eines Sprachmodells durch geschickt formulierte Prompts, sodass das Modell Inhalte produziert, die es eigentlich verweigern soll.
- Jan Lokales LLM
Jan ist eine quelloffene Desktop-Anwendung, mit der sich große Sprachmodelle lokal und vollständig offline auf dem eigenen Rechner ausführen lassen. Sie nutzt die llama.cpp-Engine und gilt als datenschutzfreundliche ChatGPT-Alternative.
K
22 Begriffe- Keyword-Glossar (STT) API-Nutzung
Ein Keyword-Glossar für Speech-to-Text ist eine kurze, kuratierte Liste eigener Fachbegriffe, Marken- und Produktnamen, die einem STT-Modell vor der Transkription als Kontext-Hint mitgegeben wird — typischerweise über Whispers `initial_prompt`.
- KI-Agent Agenten
Ein KI-Agent ist ein System, das ein Sprachmodell mit Werkzeugen kombiniert und mehrschrittig auf ein Ziel hinarbeitet — typischerweise in einer Schleife aus Beobachten, Planen und Handeln.
- KI-Bildgenerierung Produktivität
KI-Bildgenerierung bezeichnet das Erzeugen von Bildern aus Text-Prompts durch generative Modelle. Werkzeuge wie Midjourney, DALL-E, Adobe Firefly und Stable Diffusion werden im Marketing für Konzepte, Visuals und Bildbearbeitung genutzt.
- KI-Content-Workflow Strategie
Ein KI-Content-Workflow ist ein strukturierter Ablauf zur Erstellung von Inhalten, bei dem KI in mehreren Schritten unterstützt: Briefing, Entwurf, Überarbeitung, Faktenprüfung und Veröffentlichung. Der Mensch steuert, prüft und verantwortet das Ergebnis.
- KI-Datenanalyse Produktivität
KI-Datenanalyse bezeichnet das Auswerten von Daten (CSV, Excel u. a.) per natürlicher Sprache: Ein KI-System schreibt und führt im Hintergrund Code aus, um Dateien zu bereinigen, zu berechnen und zu visualisieren — z. B. ChatGPTs Advanced Data Analysis.
- KI-gestützte Personalisierung Strategie
KI-gestützte Personalisierung passt Inhalte, Angebote und Empfehlungen automatisch an einzelne Nutzer an. Modelle werten Verhaltens- und Profildaten aus, um in Echtzeit relevantere Ansprache auszuspielen — datenschutzkonform und einwilligungsbasiert.
- KI-Marketing Strategie
KI-Marketing bezeichnet den Einsatz von künstlicher Intelligenz und maschinellem Lernen, um Marketing-Daten zu analysieren, Inhalte und Aussteuerung zu automatisieren und Kampagnen in Echtzeit zu optimieren. Teilbereiche sind Content, Personalisierung, Analytics und GEO.
- KI-Meeting-Assistenten Produktivität
KI-Meeting-Assistenten sind Software-Tools, die Online-Besprechungen automatisch aufzeichnen, transkribieren, zusammenfassen und Aufgaben (Action Items) daraus ableiten. Bekannte Vertreter sind Otter, Fireflies, Fathom und Microsoft Copilot in Teams.
- KI-Präsentationen Produktivität
KI-Präsentationen sind mit Hilfe generativer KI erstellte Foliensätze. Aus einem kurzen Prompt oder einer Gliederung erzeugen Tools wie Gamma oder Beautiful.ai automatisch strukturierte Slides mit Text, Layout und passenden Bildern.
- KI-Recherche-Assistent Produktivität
Ein KI-Recherche-Assistent ist ein KI-System, das auf eine Frage hin mehrstufig im Web sucht, Quellen liest, abgleicht und zu einer belegten Antwort oder einem Report synthetisiert — z. B. ChatGPT Deep Research, Gemini Deep Research oder Perplexity.
- KI-Videogenerierung Produktivität
KI-Videogenerierung erzeugt Bewegtbild aus Text- oder Bildvorgaben. Diffusion-Transformer-Modelle wie Google Veo, Kling, Runway oder Sora entrauschen Latent-Frames schrittweise zu kohärentem Video, meist als Clips von wenigen Sekunden.
- KI-Wissensmanagement Produktivität
KI-Wissensmanagement macht verstreutes Unternehmenswissen mit KI durchsuchbar und nutzbar. Dokumente werden in Vektoren überführt, sodass Mitarbeitende per natürlicher Frage Antworten erhalten — meist über Retrieval-Augmented Generation.
- Kimi K2 Moonshot AI
Kimi K2 ist die Open-Weight-MoE-Modellreihe von Moonshot AI mit 1 Billion Parametern und 32 Mrd. aktiven Parametern, trainiert auf 15,5 Billionen Tokens — Fokus auf Agenten- und Coding-Aufgaben.
- Kimi K2 Thinking Moonshot AI
Kimi K2 Thinking (November 2025) ist Moonshot AIs offenes Reasoning-Agenten-Modell — ein Billion-Parameter-MoE mit 256K Kontext, das lange Denk- und Tool-Use-Ketten eigenständig durchläuft.
- Kimi K2.5 Moonshot AI
Kimi K2.5 ist ein im Januar 2026 veröffentlichtes offenes KI-Modell von Moonshot AI. Es ist ein natives multimodales Mixture-of-Experts-Modell mit rund 1 Billion Parametern (32 Mrd. aktiv), 256.000 Tokens Kontext und agentischen Fähigkeiten.
- Kimi K2.6 Moonshot AI
Kimi K2.6 ist Moonshot AIs Open-Weight-Agent-Modell vom April 2026 — 1 Billion Parameter (32B aktiv), 262k-Kontext, nativ multimodal, mit Agent-Swarms aus bis zu 300 Subagenten.
- Kimi K3 Moonshot AI
Kimi K3 (Juli 2026) ist Moonshot AIs Flaggschiff mit offenen Gewichten — ein MoE-Modell mit 2,8 Bio. Parametern (104 Mrd. aktiv), nativer Vision und 1-Mio.-Token-Kontext.
- Kling 3.0 Bild & Video
Kling 3.0 ist das Video-Modell von Kuaishou, veröffentlicht am 5. Februar 2026. Es erzeugt bis zu 15 Sekunden lange, fotorealistische Clips mit nativem Ton in mehreren Sprachen und gilt als preis-leistungsstärkster Video-Generator.
- Knowledge Distillation Training & Fine-Tuning
Knowledge Distillation ist ein Trainingsverfahren, bei dem ein kleines Schüler-Modell vom Verhalten eines großen Lehrer-Modells lernt — mit dem Ziel, vergleichbare Qualität bei deutlich geringerem Ressourcenbedarf zu erreichen.
- Kokoro Speech & Voice Open-Weight
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
- Kontextfenster LLM-Grundlagen
Das Kontextfenster ist die maximale Anzahl Tokens, die ein Sprachmodell gleichzeitig verarbeiten kann — Eingabe und Ausgabe zusammen.
- KV-Cache LLM-Grundlagen
Der KV-Cache (Key-Value-Cache) speichert während der Textgenerierung eines Sprachmodells die bereits berechneten Key- und Value-Vektoren der Attention-Schichten zwischen. So muss pro neuem Token nicht der gesamte Kontext neu berechnet werden, was die Inferenz deutlich beschleunigt.
L
17 Begriffe- LangChain Pipeline-Frameworks
Open-Source-Framework, das LLMs mit Datenquellen, Tools und Speicher zu Anwendungen verkettet — die wohl bekannteste Pipeline-Bibliothek für KI-Apps.
- LangGraph Agenten-Frameworks
LangGraph ist ein Open-Source-Framework von LangChain für zustandsbehaftete, graph-basierte LLM-Workflows — Knoten sind Funktionen oder Agenten, Kanten definieren den Kontrollfluss inklusive Schleifen und Verzweigungen.
- Llama 2 Llama
Llama 2 ist Metas offen gewichtetes Sprachmodell vom Juli 2023 — das erste Llama mit kommerziell nutzbarer Lizenz, in den Größen 7B, 13B und 70B mit 4K-Kontext.
- Llama 3 Llama
Am 18. April 2024 veröffentlichte offene Modellgeneration von Meta. Erschien zunächst in den Größen 8B und 70B (jeweils Basis- und Instruct-Variante) unter der Llama-3-Community-Lizenz; frei herunterladbar, für Forschung und kommerzielle Nutzung.
- Llama 3.1 Llama
Llama 3.1 (Juli 2024) ist Metas Open-Weight-Familie in 8B, 70B und 405B mit 128K-Kontext und Mehrsprachigkeit — das 405B war das erste offene Modell auf Augenhoehe mit GPT-4o und Claude 3.5 Sonnet.
- Llama 3.2 Llama
Llama 3.2 ist Metas Modellgeneration vom September 2024 — erstmals mit Vision-Unterstützung (11B/90B) und schlanken Edge-Modellen (1B/3B) für Mobil- und On-Device-Einsatz.
- Llama 3.3 Llama
Llama 3.3 (Dezember 2024) ist Metas offenes 70B-Instruct-Modell — es erreicht 405B-Klasse-Qualitaet bei 70B-Kosten, mit 128K-Kontext und offenen Gewichten.
- Llama 4 Maverick Llama
Llama 4 Maverick (April 2025) ist Metas große Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 400 Mrd. Parametern auf 128 Experten, 1-Mio.-Tokens-Kontext.
- Llama 4 Scout Llama
Llama 4 Scout (April 2025) ist Metas kleine Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 109 Mrd. Parametern, 10-Mio.-Tokens-Kontext, multimodal.
- Llama-3-SauerkrautLM-70b Llama
Llama-3-SauerkrautLM-70b ist ein deutschsprachig DPO-feingetuntes 70B-Modell auf Basis von Meta Llama 3, entwickelt von VAGOsolutions und Hyperspace.ai.
- llama.cpp Lokales LLM
llama.cpp ist eine quelloffene C++-Bibliothek zum effizienten Inferieren von LLMs auf CPU und GPU — die Engine, auf der viele lokale Tools wie Ollama und LM Studio basieren.
- Llamafile Lokales LLM
Llamafile ist ein Mozilla-Projekt, das ein lokales Sprachmodell als eine einzige ausführbare Datei verpackt — Modellgewichte und Inferenz-Engine in einem. Diese Datei läuft ohne Installation auf mehreren Betriebssystemen.
- LlamaIndex Pipeline-Frameworks
Datenrahmen für LLM-Anwendungen, spezialisiert auf das Indexieren, Anreichern und Abrufen privater Daten — Kernstück vieler RAG-Architekturen.
- LLM LLM-Grundlagen
LLM steht für Large Language Model — ein neuronales Netz, das auf großen Mengen Text trainiert wurde, um natürliche Sprache zu verarbeiten und zu erzeugen.
- LLM-as-a-Judge Evaluation
LLM-as-a-Judge bezeichnet das Verfahren, ein Sprachmodell als Bewerter einzusetzen — es vergleicht Antworten anderer Modelle oder bewertet Ausgaben gegen vorgegebene Kriterien.
- LM Studio Lokales LLM
LM Studio ist eine Desktop-Anwendung zum lokalen Betrieb von LLMs mit grafischer Oberfläche — inklusive Modell-Browser, Chat-Interface und OpenAI-kompatiblem Server.
- LoRA Training & Fine-Tuning
Low-Rank Adaptation — parameter-effizientes Fine-Tuning, bei dem nur kleine Zusatz-Matrizen trainiert werden statt aller Modellgewichte.
M
16 Begriffe- Magistral Mistral
Magistral ist Mistral AIs erstes Reasoning-Modell vom Juni 2025 — mit transparenter, nachvollziehbarer Argumentationskette und Stärke in europäischen Sprachen, teils als offene Gewichte.
- Make (Integromat) Workflow-Automation
Make (früher Integromat) ist eine cloudbasierte No-Code-Plattform zur Workflow-Automatisierung. Über eine visuelle Oberfläche verbindet man Apps und APIs zu mehrstufigen Abläufen ("Szenarien"), ohne zu programmieren — etwa um Daten zwischen Diensten zu übergeben.
- MCP Agenten
MCP — Model Context Protocol — ist ein offener Standard von Anthropic, um KI-Modelle einheitlich mit externen Datenquellen und Werkzeugen zu verbinden.
- Meshy 3D-Modelle
Meshy ist eine kommerzielle Hosted-Plattform fuer 3D-Generierung aus Text oder Bild. Version 6 erzeugt in etwa einer Minute produktionsreife Assets mit PBR-Texturen, Auto-Retopology und Rigging und gilt als vielseitiges Allround-Werkzeug.
- Meta-Prompting Prompting
Meta-Prompting ist die Technik, ein LLM einen Prompt für eine Aufgabe schreiben oder verbessern zu lassen, statt ihn selbst zu formulieren — der Prompt wird zum Output.
- Microsoft TRELLIS.2 3D-Modelle Open-Weight
Microsoft TRELLIS.2 ist das staerkste offene Bild-zu-3D-Modell (4 Mrd. Parameter, MIT-Lizenz). Es erzeugt in Sekunden hochaufloesende Assets mit nativen PBR-Materialien und unterstuetzt Gaussian Splatting; Gewichte sind auf Hugging Face frei verfuegbar.
- Midjourney v8 Bild & Video
Midjourney v8 ist die achte Generation des Bildgenerators von Midjourney (Alpha März 2026) mit rund fünffach schnellerer Erzeugung, nativer 2K-Auflösung und verbesserter Textwiedergabe.
- Milvus Vektor-Datenbanken
Milvus ist eine quelloffene, verteilte Vektordatenbank für die schnelle Ähnlichkeitssuche über große Mengen von Embeddings. Sie steht unter Apache-2.0-Lizenz im Rahmen der LF AI & Data Foundation, Hauptentwickler ist die Firma Zilliz.
- MiniMax MiniMax
MiniMax ist ein 2021 in Shanghai gegründetes KI-Labor, dessen offene M-Modellfamilie (LLMs) auf sehr lange Kontextfenster und niedrige Betriebskosten durch Sparse Attention setzt.
- Mistral 7B Mistral
Mistral 7B (September 2023) ist das erste Open-Weight-Modell von Mistral AI — ein 7,3B-Parameter-Modell unter Apache 2.0, das damals das groessere Llama 2 13B in Benchmarks uebertraf.
- Mistral Large 3 Mistral
Mistral Large 3 (Dezember 2025) ist Mistrals offenes MoE-Flaggschiff — 675 Mrd. Parameter, 256K-Tokens-Kontext, nativ multimodal, Apache 2.0.
- Mistral Medium 3 Mistral
Mistral Medium 3 ist ein im Mai 2025 veröffentlichtes proprietäres KI-Modell von Mistral AI. Es ist als Enterprise-Modell auf hohe Leistung bei niedrigen Betriebskosten ausgelegt, bietet rund 128.000 Tokens Kontext und ist auch on-premise oder in der eigenen VPC betreibbar.
- Mistral Small 4 Mistral
Mistral Small 4 ist Mistral AIs Open-Weight-MoE-Modell vom März 2026 — vereint Reasoning, Vision und Coding in einem Modell, 119B Parameter (6,5B aktiv), Apache 2.0.
- Mixtral 8x7B Mistral
Mixtral 8x7B (Dezember 2023) ist Mistral AIs offenes Sparse-MoE-Modell mit 8 Experten — 46,7 Mrd. Parameter, 12,9 Mrd. aktiv pro Token, 32K-Kontext, Apache-2.0-Lizenz.
- Model Card LLM-Grundlagen
Eine Model Card ist ein standardisiertes Datenblatt zu einem KI-Modell — sie dokumentiert Zweck, Trainingsdaten, Leistung, Limitierungen und ethische Hinweise an einer Stelle.
- Muse Spark Muse
Muse Spark ist Metas closed-weight-Flaggschiff vom April 2026 — das erste Modell der Muse-Linie aus den Meta Superintelligence Labs, mit Fokus auf effizientes Reasoning per Thought Compression.
N
1 BegriffO
6 Begriffe- Ollama Lokales LLM
Ollama ist ein Tool zum lokalen Betrieb von Sprachmodellen wie Llama, Mistral oder Qwen — Bedienung per CLI, mit OpenAI-kompatiblem HTTP-Server für Anwendungen.
- Open WebUI Lokales LLM
Open WebUI ist eine Open-Source-Chat-Oberfläche für lokale und remote LLMs — ChatGPT-ähnliche UX im Browser, läuft als Docker-Container und spricht Ollama, OpenAI-kompatible APIs und mehr an.
- Opus 4.6 Claude
Claude Opus 4.6 ist Anthropics Flaggschiff-Modell vom Februar 2026 — Top-Tier der Claude-4-Familie mit 1-Mio.-Tokens-Kontext, gestärktem Coding und neuen Effort-Controls.
- Opus 4.7 Claude
Claude Opus 4.7 ist Anthropics Top-Tier-Modell vom April 2026 — Nachfolger von Opus 4.6 mit hochauflösender Bildverarbeitung, neuem xhigh-Effort-Level und Task-Budgets für lange agentische Läufe.
- ORPO (Odds Ratio Preference Optimization) Training & Fine-Tuning
ORPO ist ein Trainingsverfahren, das überwachtes Fine-Tuning und Präferenz-Optimierung in einem einzigen Schritt vereint — schlanker als die klassische SFT-plus-RLHF-Pipeline.
- Output-Token API-Nutzung LLM-Pricing
Tokens, die ein KI-Modell als Antwort erzeugt. Werden separat berechnet und sind meist drei- bis fünfmal teurer als Input-Tokens, weil das Modell sie aktiv generieren muss.
P
13 Begriffe- PEFT (Parameter-Efficient Fine-Tuning) Training & Fine-Tuning
PEFT bündelt Verfahren, die ein vortrainiertes LLM anpassen, indem nur ein kleiner Bruchteil der Gewichte trainiert wird — typischerweise unter 1 %, statt aller Milliarden Parameter.
- Permission Mode Coding-CLI Sicherheit & Berechtigungen
Eine Globaleinstellung in Claude Code, die festlegt, wie Tool-Aufrufe behandelt werden: Plan (nur planen), Default (mit Nachfrage), Accept Edits (Files frei), Bypass (alles erlauben).
- Pfadabhängigkeit (LLM-Output) LLM-Grundlagen
Pfadabhängigkeit beschreibt, wie bei der LLM-Generierung jeder früh erzeugte Token den weiteren Verlauf festlegt — der erste verbalisierte Fund lenkt die gesamte restliche Analyse in eine Richtung.
- pgvector Vektor-Datenbanken
pgvector ist eine quelloffene PostgreSQL-Erweiterung für Vektor-Suche — bringt Embedding-Spalten, Distanzfunktionen und ANN-Indizes (HNSW, IVFFlat) direkt in die bestehende Postgres-Datenbank.
- Pinecone Vektor-Datenbanken
Pinecone ist ein gemanagter Vektor-Datenbank-Dienst für RAG- und Semantic-Search-Workloads — speichert Embeddings, beantwortet Nearest-Neighbor-Suchen und skaliert ohne dass der Nutzer den Index selbst betreibt.
- Pixtral Mistral
Erstes multimodales Modell von Mistral AI, im September 2024 unter Apache 2.0 veröffentlicht. Vision-Sprachmodell mit 12 Mrd. Parametern plus 400-Mio.-Vision-Encoder, verarbeitet Text und (mehrere) Bilder; 128K-Kontext, offene Gewichte über Hugging Face.
- Prefix Tuning Training & Fine-Tuning
Prefix Tuning ist ein PEFT-Verfahren, bei dem nicht Modellgewichte, sondern eine Folge gelernter „virtueller Tokens" trainiert wird, die der Eingabe vorangestellt werden — das Basis-Modell bleibt eingefroren.
- Prompt Caching API-Nutzung LLM-Pricing
Prompt Caching ist eine API-Funktion, bei der ein Anbieter wiederkehrende Prompt-Bestandteile zwischenspeichert — Folgeanfragen werden dadurch günstiger und schneller, weil der gecachte Teil nicht erneut verarbeitet wird.
- Prompt Engineering Prompting
Prompt Engineering ist die Disziplin, KI-Modelle durch gezielt gestaltete Eingabeaufforderungen zu steuern — also durch präzises Schreiben statt klassische Programmierung.
- Prompt Injection Prompting
Prompt Injection ist ein Angriff, bei dem in den Eingabe-Daten eines LLMs Anweisungen versteckt werden, die das Modell dazu bringen, seine ursprünglichen Anweisungen zu ignorieren oder zu unterlaufen.
- Prompt Leaking Prompting
Prompt Leaking ist ein Angriff, der ein LLM dazu bringt, seinen versteckten System-Prompt oder andere vertrauliche Kontext-Inhalte preiszugeben — ein Sonderfall der Prompt Injection.
- Prompt Template Prompting
Ein Prompt Template ist ein wiederverwendbares Prompt-Gerüst mit Platzhaltern, in das pro Aufruf konkrete Werte eingesetzt werden — Grundlage für reproduzierbare LLM-Aufrufe in Anwendungen.
- Prompt-Bibliothek Prompting
Eine Prompt-Bibliothek ist eine zentrale, geordnete Sammlung wiederverwendbarer und versionierter Prompts in einem Team. Sie stellt bewährte Eingaben für KI-Modelle bereit, damit sie nicht bei jeder Nutzung neu formuliert werden müssen.
Q
11 Begriffe- Qdrant Vektor-Datenbanken
Qdrant ist eine Open-Source-Vektor-Datenbank in Rust — speichert Embeddings für Semantic Search, RAG und Empfehlungssysteme, läuft lokal, im eigenen Cluster oder als gemanagte Cloud.
- QLoRA Training & Fine-Tuning
Erweiterung von LoRA, die das Basismodell auf 4 Bit quantisiert — dadurch lassen sich auch sehr große LLMs auf einer einzelnen GPU fein-tunen.
- Quantisierung Lokales LLM
Quantisierung reduziert die numerische Präzision der Modellgewichte — z. B. von 16-bit float auf 4-bit Integer — und macht Sprachmodelle so klein und schnell genug für Consumer-Hardware, mit überschaubarem Qualitätsverlust.
- Query Expansion RAG
Query Expansion erweitert die ursprüngliche Suchanfrage in einer RAG-Pipeline um Synonyme, Reformulierungen oder hypothetische Antwort-Texte, um die Trefferquote des Retrievals zu erhöhen.
- Qwen 2.5 Qwen
Im September 2024 veröffentlichte offene Modellfamilie von Alibaba. Umfasst Basisgrößen von 0,5B bis 72B Parametern plus Coder- und Math-Varianten; 128K-Kontext, mehrsprachig. Kleinere Größen unter Apache 2.0, das 72B-Modell unter eigener Qwen-Lizenz.
- Qwen 3 Qwen
Qwen 3 ist die im April 2025 veröffentlichte Familie offener KI-Modelle von Alibaba. Sie reicht von 0,6B bis 235B Parametern (dichte und MoE-Modelle), steht unter Apache-2.0-Lizenz und vereint einen Thinking- und einen Non-Thinking-Modus in einem Modell.
- Qwen 3.5 Qwen
Qwen 3.5 (Februar 2026) ist Alibabas offene Modellfamilie der dritten Generation — von 0,8B bis 397B Parameter, MoE-Flaggschiff mit 1-Mio.-Tokens-Kontext, multimodal.
- Qwen 3.6 Qwen
Qwen 3.6 ist Alibabas Open-Weights-Modell vom April 2026 — die dichte 27B-Variante erreicht auf agentischen Coding-Benchmarks das Niveau deutlich größerer MoE-Modelle, unter Apache-2.0-Lizenz.
- Qwen 3.7-Max Qwen
Qwen 3.7-Max (Mai 2026) ist Alibabas proprietaeres Max-Flaggschiff mit 1-Mio.-Tokens-Kontext, positioniert als „Agent Frontier" fuer lange, tool-intensive Agenten-Workflows.
- Qwen 3.8-Max Qwen
Qwen 3.8-Max (August 2026) ist Alibabas groesstes Flaggschiff — ein MoE-Modell mit 2,4 Bio. Parametern, 1-Mio.-Token-Kontext und multimodalem Input, spaeter mit offenen Gewichten.
- Qwen3-Max Qwen
Qwen3-Max ist Alibabas Billion-Parameter-Flaggschiff vom September 2025 — ein Mixture-of-Experts-Modell mit 262K Kontext, das anders als frühere Qwen-Modelle nur über API zugänglich ist.
R
10 Begriffe- RAG LLM-Grundlagen
RAG (Retrieval-Augmented Generation) verbindet ein Sprachmodell mit einer externen Wissensquelle — passende Passagen werden gesucht und mit der Frage zusammen ans Modell gegeben.
- RAGAS Evaluation
RAGAS ist ein Open-Source-Framework zur automatisierten Bewertung von RAG- und Agenten-Pipelines — mit Standardmetriken wie Faithfulness, Context Precision und Answer Relevancy.
- Rate Limit (KI) API-Nutzung LLM-Pricing
Vom API-Anbieter durchgesetzte Obergrenze für Anfragen oder Tokens pro Zeitfenster — schützt die Infrastruktur und sichert faire Nutzung über alle Kunden hinweg.
- ReAct (Prompting) Prompting
ReAct ist ein Prompting-Muster, das ein LLM zwischen Reasoning (Gedanken) und Action (Tool-Aufrufen) abwechseln lässt — Grundlage vieler Agenten-Implementierungen.
- Reasoning Effort LLM-Grundlagen
Reasoning Effort ist ein Steuerparameter moderner Reasoning-Modelle, der festlegt, wie viel internes Schritt-für-Schritt-Denken (Thinking-Tokens) ein Modell vor der Antwort aufwendet — höhere Stufen erhöhen Qualität, aber auch Latenz und Kosten.
- Recall Evaluation
Recall (Trefferquote, Sensitivität) misst, welcher Anteil aller tatsächlich vorhandenen relevanten Fälle gefunden wird. Formel: gefundene relevante Fälle geteilt durch alle real vorhandenen relevanten Fälle. Setzt eine bekannte Ground Truth voraus.
- Reranking RAG
Reranking ordnet eine bereits gefundene Trefferliste mit einem genaueren Modell neu — typisch ein Cross-Encoder, der Anfrage und jeden Kandidaten gemeinsam bewertet, statt nur Vektor-Abstände zu vergleichen.
- RLHF Training & Fine-Tuning
Reinforcement Learning from Human Feedback — Trainingsverfahren, das Modelle anhand von menschlichen Präferenz-Vergleichen auf hilfreiches und sicheres Verhalten ausrichtet.
- Role Prompting Prompting
Role Prompting weist einem LLM eine konkrete Rolle oder Persona zu („Du bist ein erfahrener Steueranwalt …"), um Stil, Vokabular und Antworttiefe gezielt zu steuern.
- Runway Gen-4.5 Bild & Video
Runway Gen-4.5 ist das Video-Modell von Runway, das aus Text oder Bild 5- und 10-Sekunden-Clips mit starker Prompt-Treue und cineastischer Bewegung erzeugt. Es entstand mit NVIDIA und nutzt eine Autoregressive-to-Diffusion-Technik.
S
17 Begriffe- Safetensors LLM-Grundlagen
Safetensors ist ein von Hugging Face entwickeltes Dateiformat zum Speichern von Modellgewichten — schneller, sicherer und sprachübergreifender als das ältere PyTorch-Format `.pt`/`.bin`.
- Sampling (LLM) LLM-Grundlagen
Sampling ist das gewichtete Ziehen des nächsten Tokens aus der Wahrscheinlichkeitsverteilung eines Sprachmodells — gesteuert über Temperatur, Top-p und Top-k. Es erzeugt die Variabilität zwischen zwei Läufen.
- SauerkrautLM Open-Weight
SauerkrautLM ist eine deutschsprachige LLM-Familie des deutschen Startups VAGOsolutions — Feintunings auf Basis von Llama, Qwen, Mistral und anderen offenen Architekturen.
- Sec-Gemini v1 Security-Modelle
Sec-Gemini v1 ist Googles experimentelles, auf Gemini basierendes KI-Modell fuer Cybersecurity. Es kombiniert Gemini-Reasoning mit aktueller Threat Intelligence aus Mandiant, der OSV-Schwachstellendatenbank und Google Threat Intelligence.
- Seedream 4.0 Bild & Video
Seedream 4.0 ist ByteDances multimodales Bildmodell (September 2025), das Text und mehrere Bilder als Eingabe verarbeitet, bis zu 4K rendert und über zehnmal schneller ist als Seedream 3.0.
- Self-Consistency Prompting
Self-Consistency ist eine Prompting-Technik, bei der dieselbe Frage mehrfach mit Chain-of-Thought beantwortet und die häufigste Antwort als finales Ergebnis gewählt wird.
- Self-Refine Prompting
Self-Refine ist eine Prompting-Technik, bei der ein Modell seinen eigenen Output kritisiert und in mehreren Iterationen verbessert — ohne menschliches Feedback.
- Semantic Search RAG
Semantische Suche findet Inhalte über Bedeutung statt über exakte Wortübereinstimmung — Anfrage und Dokumente werden als Embeddings verglichen, sodass auch Synonyme und Umschreibungen treffen.
- SFT (Supervised Fine-Tuning) Training & Fine-Tuning
SFT bezeichnet das überwachte Nachtrainieren eines vortrainierten Sprachmodells auf einem Datensatz aus Eingabe-Ausgabe-Paaren — der Schritt, der ein Basis-Modell in einen brauchbaren Assistenten verwandelt.
- Spaces (Hugging Face Spaces) Hugging Face
Hugging Face Spaces ist eine Hosting-Plattform, auf der sich interaktive Machine-Learning-Anwendungen ohne eigene Server-Infrastruktur bereitstellen und teilen lassen. Apps werden direkt im Browser nutzbar, etwa über Gradio, Streamlit, Docker oder statisches HTML.
- Speech-to-Text (STT) Workflows Produktivität
Speech-to-Text bezeichnet die automatische Umwandlung gesprochener Sprache in Text durch ein KI-Modell. Im KI-Workflow ersetzt STT die Tastatur als Eingabekanal — entscheidend ist die Modellgröße und das domänenspezifische Vokabular.
- Spotlighting Prompting
Spotlighting ist eine Verteidigungstechnik gegen Prompt Injection, bei der nicht-vertrauenswürdige Eingaben markiert werden, damit das Modell sie als Daten — nicht als Anweisungen — behandelt.
- Stop Sequences LLM-Grundlagen
Stop Sequences sind Zeichenketten, bei deren Auftreten ein LLM die Token-Generierung sofort beendet. Sie begrenzen die Ausgabe gezielt, etwa um Rollenwechsel, Format-Marker oder überlange Antworten zu verhindern.
- Streaming (LLM) API-Nutzung
Streaming bezeichnet die Übertragung der LLM-Antwort tokenweise in Echtzeit — der Nutzer sieht den Text Wort für Wort statt erst am Ende der gesamten Generierung.
- Structured Output / JSON Mode Agenten
Structured Output bezeichnet die Fähigkeit eines Sprachmodells, Antworten in einem festgelegten Schema (typischerweise JSON) zu liefern — verlässlich genug, um direkt von Folge-Code weiterverarbeitet zu werden.
- Synthetic Data Training & Fine-Tuning
Synthetic Data sind künstlich erzeugte Trainings- oder Testdaten — meist von einem Sprachmodell selbst generiert, um Datensätze zu erweitern, ohne reale Quellen zu benötigen.
- System-Prompt Prompting
Der System-Prompt ist die Instruktion, die das Verhalten eines Sprachmodells über eine ganze Konversation festlegt — im Unterschied zum Nutzer-Prompt, der pro Nachricht variiert.
T
14 Begriffe- Temperature LLM-Grundlagen
Temperature ist ein Sampling-Parameter, der steuert, wie deterministisch oder kreativ ein Sprachmodell antwortet — niedrige Werte machen Antworten konservativ, hohe Werte vielfältiger.
- TensorRT-LLM Lokales LLM
TensorRT-LLM ist eine quelloffene Bibliothek von NVIDIA, die LLM-Inferenz auf NVIDIA-GPUs optimiert. Sie kompiliert Modelle in hochoptimierte Laufzeit-Engines und bietet In-Flight-Batching, Paged-KV-Cache und Quantisierung für hohen Durchsatz bei niedriger Latenz.
- Text-Generation-WebUI Lokales LLM
Text-Generation-WebUI (oobabooga) ist eine quelloffene Web-Oberfläche zum lokalen Betreiben von LLMs. Sie bündelt mehrere Inferenz-Backends, Chat- und Completion-Modi sowie eine OpenAI-kompatible API unter einer gemeinsamen Bedienoberfläche.
- TGI (Text Generation Inference) Lokales LLM
TGI (Text Generation Inference) ist ein quelloffenes Toolkit von Hugging Face zum performanten Bereitstellen großer Sprachmodelle. Es liefert einen produktionsreifen Inferenz-Server mit Continuous Batching, Token-Streaming und optimierten Attention-Verfahren.
- Thinking Budget LLM-Grundlagen
Das Thinking Budget (Token-Budget) ist die maximale Zahl interner Reasoning-Tokens, die ein Reasoning-Modell pro Anfrage fürs „Nachdenken" verbrauchen darf — es steuert die Abwägung zwischen Antworttiefe und Kosten bzw. Latenz.
- Tier-Pricing API-Nutzung LLM-Pricing
Mehrstufiges Modell-Angebot eines Anbieters — kleine, schnelle Varianten (Mini/Flash/Haiku) zum Bruchteil des Preises der großen Frontier-Modelle. Auch: Volume-Tiers mit Mengenrabatt.
- Token LLM-Grundlagen
Ein Token ist die kleinste Einheit, mit der ein Sprachmodell intern arbeitet — meist ein Wortteil, gelegentlich ein einzelnes Zeichen.
- Tokenizer LLM-Grundlagen
Ein Tokenizer ist das Programm, das Text in Tokens zerlegt, bevor ein Sprachmodell ihn verarbeiten kann — er bestimmt, wie viele Tokens ein Text kostet.
- Tool Call Agenten
Aufruf eines Werkzeugs durch ein KI-Modell während einer Konversation — etwa Datei-Lesen, Bash-Befehle, Web-Recherche oder ein MCP-Tool. Grundlage agentischer Workflows.
- Top-p / Top-k LLM-Grundlagen
Top-p (Nucleus Sampling) und Top-k sind Sampling-Strategien für LLMs, die festlegen, aus welcher Token-Auswahl pro Schritt gezogen wird — sie steuern zusammen mit der Temperatur die Kreativität der Ausgabe.
- TPM/RPM API-Nutzung
TPM (Tokens pro Minute) und RPM (Requests pro Minute) sind die beiden gängigen Einheiten, in denen KI-API-Anbieter ihre Rate Limits ausdrücken — TPM begrenzt das Token-Volumen, RPM die Anzahl der Anfragen pro Minute.
- Transformers (Library) Hugging Face
Open-Source-Python-Bibliothek von Hugging Face, die einen einheitlichen Zugriff auf tausende vortrainierte Modelle für Text, Bild und Audio bietet.
- Tree of Thoughts Prompting
Tree of Thoughts (ToT) ist eine Prompting-Technik, bei der ein LLM mehrere Lösungspfade als verzweigten Baum exploriert, bewertet und nur vielversprechende Äste weiterverfolgt — eine Verallgemeinerung von Chain-of-Thought.
- Tripo AI 3D-Modelle
Tripo AI ist eine kommerzielle 3D-Generierungsplattform von VAST AI. Version 3.1 fuehrt 2026 die ELO-Arena-Rankings an und liefert aus Text oder Bild game-ready Modelle mit sauberer Quad-Topologie, PBR-Texturen und Auto-Rigging.
V
4 Begriffe- Vektor-Datenbank RAG
Eine Vektor-Datenbank speichert Embeddings als hochdimensionale Vektoren und sucht darin nach semantischer Ähnlichkeit — die Kerninfrastruktur für RAG, semantische Suche und Empfehlungssysteme.
- Veo 3.1 Bild & Video
Veo 3.1 ist Googles Video-Modell (DeepMind), das aus Text oder Bild 8-Sekunden-Clips mit nativ synchronisiertem Ton erzeugt. Seit dem Update im Januar 2026 liefert es echtes 4K (3840x2160) sowie vertikale Formate.
- vLLM Lokales LLM
vLLM ist ein quelloffener Hochdurchsatz-Inferenzserver für LLMs — bekannt für PagedAttention, kontinuierliches Batching und einen OpenAI-kompatiblen API-Endpoint, weit verbreitet in produktiven Self-Hosting-Setups.
- VRAM Lokales LLM
VRAM (Video RAM) ist der dedizierte Speicher einer GPU — beim lokalen Betrieb von Sprachmodellen die wichtigste Hardware-Größe, weil das gesamte Modell und der Kontext idealerweise dort hineinpassen müssen.
W
5 Begriffe- Weaviate Vektor-Datenbanken
Weaviate ist eine quelloffene Vektor-Datenbank in Go — sie speichert Objekte samt Embeddings, kombiniert semantische und Keyword-Suche (BM25) und bietet integrierte Vektorisierung, RAG und Multi-Mandanten-Betrieb.
- Whisper LLM-Grundlagen Speech & Voice
Whisper ist OpenAIs offenes Speech-to-Text-Modell von 2022 — ein mehrsprachiger Encoder-Decoder-Transformer, der Audio in Text umwandelt und in mehreren Größen unter MIT-Lizenz verfügbar ist.
- Whisper initial_prompt API-Nutzung
Mit dem Parameter `initial_prompt` lässt sich Whisper vor der Transkription eine Keyword-Liste oder ein Beispielsatz mitgeben. Das Modell behandelt diesen Text als Kontext und erkennt darin enthaltene Begriffe deutlich zuverlässiger.
- whisper.cpp Lokales LLM
whisper.cpp ist eine quelloffene C++-Portierung von OpenAIs Whisper-Spracherkennung — eine kompakte Native-Binary für lokale Transkription auf CPU, CUDA, Metal oder Vulkan, ohne Python-Abhängigkeit.
- Windsurf AI-IDE
Windsurf ist eine KI-IDE auf VS-Code-Basis mit Fokus auf agentische Coding-Workflows — der Cascade-Agent plant und führt mehrschrittige Änderungen autonom aus.
X
1 BegriffZ
2 Begriffe- Zapier AI Workflow-Automation
Zapier AI bündelt die KI-Funktionen der Automatisierungs-Plattform Zapier — darunter Copilot zum Bauen von Workflows per Sprache, autonome Agents, Chatbots und einen MCP-Server, der Tausende Zapier-Aktionen für externe Sprachmodelle bereitstellt.
- Zero-Shot Prompting
Zero-Shot beschreibt das Lösen einer Aufgabe durch ein Sprachmodell ohne mitgelieferte Beispiele — allein über die Aufgabenbeschreibung im Prompt.