Anthropic: Claude schreibt über 80 % des eigenen Codes — und ruft nach einem Pause-Knopf
Anthropic legt Zahlen offen: Claude schreibt >80 % des Produktionscodes. Zugleich plädiert die Firma für die Option, die Frontier-Entwicklung zu pausieren.
Konkrete KI-Modelle und Modellfamilien im Überblick — wer sie entwickelt, wie sie sich in Reasoning, Coding, Multimodalität und Preis unterscheiden und wofür die einzelnen Linien im Alltag am besten taugen. Gegliedert nach Anbieter-Familien (GPT, Claude, Gemini …) und übergreifenden Einsatzzwecken wie Security, Bild & Video oder Open-Weight.
Ein KI-Modell ist ein trainiertes neuronales Netz, das aus Beispielen ein Muster gelernt hat — und dieses Muster nutzt, um neue Eingaben zu verarbeiten. „Modell” ist dabei wörtlich gemeint: eine mathematische Nachbildung dessen, was in den Trainingsdaten steckt. Wenn du heute mit ChatGPT, Claude oder Gemini chattest, sprichst du mit einem Sprachmodell — der derzeit prominentesten Form. Es gibt aber auch Modelle für Bilder, Audio, Video oder Code, und zunehmend solche, die mehrere dieser Modalitäten gleichzeitig beherrschen.
Wichtig zur Abgrenzung: „KI” ist der Oberbegriff für alles, was Maschinen intelligent erscheinen lässt. „KI-Modell” ist konkret das Stück Software, das die eigentliche Arbeit erledigt. Und ein „Algorithmus” ist die Methode, mit der das Modell trainiert wurde — nicht das Modell selbst.
Im Training bekommt das Modell riesige Datenmengen vorgesetzt — bei großen Sprachmodellen (LLMs) sind das Texte aus dem Web, Büchern, Code-Repositories und vielem mehr. Aus diesen Daten lernt es Wahrscheinlichkeiten: Welches Wort folgt typischerweise auf welches? Welche Bildregionen gehören zusammen? Das Ergebnis sind Parameter — Zahlen, die das gelernte Muster speichern. Ein modernes Sprachmodell hat Milliarden bis Billionen davon.
Wenn du dem Modell später eine Frage stellst, zerlegt es deinen Text in Tokens (kleine Wort- oder Zeichenstücke) und berechnet Schritt für Schritt das nächste wahrscheinlichste Token — und dann das übernächste, und so weiter, bis die Antwort steht. Das ist der ganze Trick: Vorhersage des nächsten Tokens, milliardenfach pro Antwort.
Was ein Modell gut kann, hängt von drei Faktoren ab: den Trainingsdaten, der Modellgröße (mehr Parameter = oft mehr Fähigkeit, aber auch teurer) und dem Nachtraining — etwa Fine-Tuning auf Spezialaufgaben oder RLHF, mit dem Modelle gelernt haben, hilfreiche statt nur wahrscheinliche Antworten zu geben.
Grob lassen sich heutige KI-Modelle in drei Kategorien einteilen:
Closed-Source-Modelle stammen von kommerziellen Anbietern wie OpenAI (GPT-Reihe), Anthropic (Claude), Google (Gemini) oder xAI (Grok). Sie laufen auf den Servern der Anbieter und sind über APIs oder Chat-Apps zugänglich. Stärken: meist führend bei Qualität und Multimodalität. Nachteile: laufende Kosten pro Anfrage, Datenschutz-Fragen, Abhängigkeit vom Anbieter.
Open-Weight-Modelle wie Meta Llama, Mistral, DeepSeek, Alibaba Qwen oder Z.ai GLM kannst du herunterladen und selbst betreiben — auf eigenen Servern oder über spezialisierte Hoster. Die Lücke zu den Closed-Modellen ist in den letzten Jahren stark geschrumpft; bei vielen Aufgaben sind Open-Weight-Modelle inzwischen konkurrenzfähig oder besser.
Lokale Modelle sind eine Unterkategorie: kleinere oder stark komprimierte Open-Weight-Modelle, die auf einem normalen Rechner oder Laptop laufen — über Tools wie Ollama oder LM Studio. Vorteile: kostenlos, offline, datenschutzfreundlich. Grenzen: weniger leistungsfähig als die großen Cloud-Modelle, brauchen ausreichend RAM und idealerweise eine GPU.
Innerhalb jeder Kategorie gibt es zusätzlich Spezialisierungen: Coding-Modelle (GPT-Codex, Codestral, DeepSeek-Coder), Reasoning-Modelle für komplexes Schlussfolgern, multimodale Modelle für Bild/Audio/Video, und kleine, schnelle Varianten („Mini”, „Flash”, „Haiku”) für hohe Volumen bei niedrigen Kosten.
Unten siehst du eine Themenwelt rund um KI-Modelle: aktuelle News zu neuen Releases, Blog-Artikel mit Hintergrund und Praxis, Lexikon-Artikel für tieferes Eintauchen und ein Glossar der wichtigsten Begriffe. Über die Filter darüber kannst du gezielt nach Anbieter wechseln — OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek und weitere — oder dir das Thema LLM-Pricing ansehen, wenn dich vor allem Kosten und Abrechnungsmodelle interessieren.
Anthropic legt Zahlen offen: Claude schreibt >80 % des Produktionscodes. Zugleich plädiert die Firma für die Option, die Frontier-Entwicklung zu pausieren.
Anthropic hat Claude Fable 5.1 und Mythos 5.1 veröffentlicht. Basispreis bleibt, aber Cache-Reads sind 75% günstiger und der Verbrauch sinkt.
Anthropic hat Claude Opus 5.5 veröffentlicht: 4 / 20 $ pro Mio. Token, rund 40 % günstiger als Opus 5 und in Coding-Benchmarks vor Fable 5.1.
Anthropic hat Opus 5 veröffentlicht — gleicher Token-Preis wie 4.8, laut Anbieter Fable-nahe Leistung bei rund halben Kosten pro Aufgabe.
Anthropic hat Claude Sonnet 5.5 veröffentlicht: 2 / 10 $ pro Mio. Token, Opus-nahe Benchmarks, aber nur bei max-Effort. AA-Index 56 schlägt Astra.
OpenAI hat GPT-6.1 Sol veröffentlicht: 2 / 10 $ pro Mio. Token, fast Astra-Niveau bei Coding, aber im Gesamtindex hinter Anthropics Modellen.
Ich habe GPT-6 Astra und Fable 5.1 unabhängig RLS, API-Autorisierung und Mandantentrennung prüfen lassen. Der Cross-Review machte den Unterschied.
Erst blockierte Astra meine Cybersecurity-Anfrage. Der Hinweis führte mich zu Trusted Access, zur Identitätsprüfung und in OpenAIs Daybreak-Programm.
Sol 6.1 löst einen Merge mit 12 Konfliktdateien sauber, Opus 5.5 prüft. Dann repariert es zwei Stunden lang Fehler außerhalb des Auftrags.
KI-Rückblick August 2026: Sonnet-5-Preisstopp, Qwen3.8-Max, die Open-Weight-Welle, Google AI Mode auf Gemini Flash und der EU AI Act — eingeordnet.
Ich habe GPT-6.1 Sol direkt nach dem Release in boostN eingebunden. Erste Tasks laufen zuverlässig. Meine frühe Einordnung mit Vergleichsgrafik.
Juli 2026 im KI-Markt: Sonnet 5 und Opus 5 bei Anthropic, GPT-5.6 nach US-Review, Kimi K3 als Open Weight und neue GEO-Controls in der Search Console.