Zum Inhalt

Modellvergleich auf Kundendaten.

Das richtige Modell für Ihre Aufgabe. Mit Zahlen, die Ihre Entscheidung tragen.

Wir vergleichen drei geeignete KI-Modelle mit einem kleinen Testset aus Ihrem Alltag: Qualität, Laufzeit und Kosten. Sie erhalten eine klare Empfehlung mit Messdaten und Grenzen – unabhängig vom Modellanbieter.

Modellkenntnis aus eigener Security-Praxis: Franz Bettag entwickelt eine Bug-Bounty-Plattform mit mehreren Modellfamilien. Seine Arbeit ist öffentlich belegt: #2 VDP Researcher Deutschland, Januar–März 2026. Workflow und Nachweis ansehen

Mehr Intelligenz pro Dollar.

15 aktuelle Modelle. Ein Blick auf Leistung und Preis zeigt, wo sich ein genauer Test mit Ihren Daten lohnt.

Intelligenz vs. TokenpreisWeiter oben: stärker im Benchmark. Weiter links: günstiger.
Intelligence Index · v4.2 0 10 20 30 40 50 60 $0 $5 $10 $15 $20 Tokenpreis · USD / 1 Mio. · linear ab 0 Claude Fable 5.1 · max · default fallback · 56.76 · 20.00 USD Claude Fable 5.1 Claude Opus 5 · max · 54.05 · 10.00 USD Claude Opus 5 Claude Sonnet 5 · max · 45.11 · 4.00 USD Claude Sonnet 5 Claude Haiku 4.5 · reasoning · 22.46 · 2.00 USD Claude Haiku 4.5 GPT-6 Astra · max · 54.66 · 20.00 USD GPT-6 Astra GPT-5.6 Sol · max · 51.26 · 8.00 USD GPT-5.6 Sol GPT-5.6 Terra · max · 46.77 · 4.50 USD GPT-5.6 Terra GPT-5.6 Luna · max · 43.44 · 0.45 USD GPT-5.6 Luna GLM-5.3 · max · 48.58 · 2.15 USD GLM-5.3 GLM-5.3 Flash · reasoning · 46.22 · 0.24 USD GLM-5.3 Flash Kimi K3 · max · 50.23 · 6.00 USD Kimi K3 MiniMax M3 · reasoning · 35.75 · 0.52 USD MiniMax M3 Qwen3.8 Max · reasoning · 46.91 · 3.00 USD Qwen3.8 Max Qwen3.7 Plus · reasoning · 30.81 * · 0.70 USD Qwen3.7 Plus * Intelligence Index · v4.2 0 10 20 30 40 50 60 $0 $5 $10 $15 $20 Tokenpreis · USD / 1 Mio. · linear ab 0 Claude Fable 5.1 · max · default fallback · 56.76 · 20.00 USD 1 Claude Opus 5 · max · 54.05 · 10.00 USD 2 Claude Sonnet 5 · max · 45.11 · 4.00 USD 3 Claude Haiku 4.5 · reasoning · 22.46 · 2.00 USD 4 GPT-6 Astra · max · 54.66 · 20.00 USD 5 GPT-5.6 Sol · max · 51.26 · 8.00 USD 6 GPT-5.6 Terra · max · 46.77 · 4.50 USD 7 GPT-5.6 Luna · max · 43.44 · 0.45 USD 8 GLM-5.3 · max · 48.58 · 2.15 USD 9 GLM-5.3 Flash · reasoning · 46.22 · 0.24 USD 10 Kimi K3 · max · 50.23 · 6.00 USD 11 MiniMax M3 · reasoning · 35.75 · 0.52 USD 12 Qwen3.8 Max · reasoning · 46.91 · 3.00 USD 13 Qwen3.7 Plus · reasoning · 30.81 * · 0.70 USD 14
Claude Sonnet 5 2.00 USD Input / 10.00 USD Output je 1 Mio. Tokens Index 45.11 · max Preisquelle Benchmark & Einstellungen

Lineare Preisachse ab 0: Doppelt so weit rechts bedeutet doppelt so teuer. Preismix: 75 % Input + 25 % Output, ohne Cache und Batch. Die tatsächlichen Tokens pro Aufgabe unterscheiden sich je Modell. Benchmark: Artificial Analysis Intelligence Index v4.2. Stand: .

Qwen3.8 Flash: 0,15 USD Input / 0,47 USD Output je Mio. Tokens; noch ohne verifizierten Indexwert. Qwen führt die API-Varianten Max, Plus und Flash. Die Qwen-Preise beziehen sich auf den Tarif International.

5-facher Tokenpreis.Fable 5.1: 20 USD. Sonnet 5: 4 USD je Mio. Tokens im 3:1-Mix. Sonnet kostet damit 80 % weniger; gegenüber Opus 5 sind es 60 %.

Der Test entscheidet.GLM-5.3 Flash liegt im selben Preismix bei rund 0,24 USD. Ob ein günstigeres Modell Ihre Aufgabe zuverlässig löst, prüfen wir mit Ihren Daten und klaren Abnahmekriterien.

Alle Tokenpreise und Ihr Monatsvolumen berechnen

Bitte ganze Zahlen ab 0 eingeben: maximal 1 Milliarde Aufgaben, 256.000 Input- und 2 Millionen Output-Tokens.

USD je 1 Mio. Tokens · ein Aufruf pro Aufgabe · Output inklusive berechnetem Thinking
Modell Input Output Monatskosten Quelle
Claude Fable 5.1 10.00 USD 50.00 USD 450.00 USD Preisliste: Claude Fable 5.1
Claude Opus 5 5.00 USD 25.00 USD 225.00 USD Preisliste: Claude Opus 5
Claude Sonnet 5 2.00 USD 10.00 USD 90.00 USD Preisliste: Claude Sonnet 5
Claude Haiku 4.5 1.00 USD 5.00 USD 45.00 USD Preisliste: Claude Haiku 4.5
GPT-6 Astra 10.00 USD 50.00 USD 450.00 USD Preisliste: GPT-6 Astra
GPT-5.6 Sol 4.00 USD 20.00 USD 180.00 USD Preisliste: GPT-5.6 Sol
GPT-5.6 Terra 2.00 USD 12.00 USD 100.00 USD Preisliste: GPT-5.6 Terra
GPT-5.6 Luna 0.20 USD 1.20 USD 10.00 USD Preisliste: GPT-5.6 Luna
GLM-5.3 1.40 USD 4.40 USD 50.00 USD Preisliste: GLM-5.3
GLM-5.3 Flash 0.15 USD 0.50 USD 5.50 USD Preisliste: GLM-5.3 Flash
Kimi K3 3.00 USD 15.00 USD 135.00 USD Preisliste: Kimi K3
MiniMax M3 0.30 USD 1.20 USD 12.00 USD Preisliste: MiniMax M3
Qwen3.8 Max 2.00 USD 6.00 USD 70.00 USD Preisliste: Qwen3.8 Max
Qwen3.7 Plus 0.40 USD 1.60 USD 16.00 USD Preisliste: Qwen3.7 Plus
Qwen3.8 Flash 0.15 USD 0.47 USD 5.35 USD Preisliste: Qwen3.8 Flash

Monatskosten = Aufgaben × (Input-Tokens × Inputpreis + Output-Tokens × Outputpreis) ÷ 1.000.000. Ohne Cache, Batch, Tools, Steuern und Sonderverträge. Eine Preisrechnung, keine Modellaufrufe oder Prüfung von Modelllimits.

Tarifdetails: GPT-5.6 Sol nutzt den Aktionspreis, laut OpenAI mindestens bis 21.11.2026 verfügbar. GLM-5.3 Flash zeigt den regulären Preis; bis 09.09.2026, 24:00 UTC+8, gelten 0,075 / 0,25 USD. Qwen3.7 Plus zeigt den regulären Preis der Version 2026-05-26 bis 256K Input-Tokens. MiniMax M3: Standardtarif bis 512K. OpenAI: Tarif bis 272K Input-Tokens. Größere Kontexte können teurer sein.

Gleicher Text bedeutet nicht gleiche Tokenzahl. Tokenisierung, Thinking, Antwortlänge und Wiederholungen unterscheiden sich. Im Kundentest messen wir deshalb Kosten je akzeptiertem Ergebnis mit den tatsächlich abgerechneten Tokens. Der allgemeine Benchmark ersetzt diese Prüfung nicht.

Modellkenntnis aus echter Security-Arbeit.

Recherche. Gegenprüfung. Belastbare Belege. Genau dort lernen wir die Stärken und Fehlergrenzen von Modellen kennen.

#2

VDP Researcher Deutschland

HackerOne · Januar–März 2026

Franz Bettags eigene Bug-Bounty-Plattform verbindet spezialisierte Agenten mit getrennten Recherche- und Prüfphasen. Die Konfiguration umfasst sechs Modellfamilien: OpenAI, Claude, GLM, Kimi, MiniMax und DeepSeek. Das Modellprofil lässt sich je Phase wählen.

Diese Praxis fließt in Ihren Vergleich ein: Aufgaben sinnvoll aufteilen, Ergebnisse gegenprüfen und Fehlversuche mitbewerten.

Die Bug-Bounty-Fallstudie
Historischer HackerOne-Ranking-Screenshot: fbettag auf Platz 2 mit Signal 7.00.
Historischer Screenshot aus dem Vortrag vom 16. April 2026. Zeitraum und Kategorie sind auf der Veranstaltungsseite dokumentiert. Veranstaltungsnachweis · Vortrag

Kleines Testset. Belastbare Entscheidung.

Ein abgegrenzter Anwendungsfall reicht für den Einstieg: etwa Support-Antworten, Dokumentenextraktion, Klassifikation oder Zusammenfassungen. Wir testen, was Ihr Betrieb tatsächlich braucht.

  1. 1

    Aufgabe und Abnahme festlegen

    Typischer Start: 30–50 repräsentative Beispiele inklusive Randfällen, Referenzantworten und klarer Bewertungsrubrik. Unsere Security-Erfahrung hilft, gezielt auch widersprüchliche Anweisungen und manipulierte Inhalte als Testfälle einzubeziehen, wo sie für Ihre Anwendung relevant sind. Auswahl und Umfang vereinbaren wir vorab.

  2. 2

    Drei Modelle auswählen

    Passend zu Aufgabe, Sprache, Datenfreigabe und Budget. Ihr heutiges Modell kann die Baseline sein. Die Auswahl erfolgt anbieterneutral; ein günstiger Kandidat muss fachlich geeignet sein.

  3. 3

    Vergleichbar messen

    Gleiches Testset und gleiche Abnahmekriterien. Wir protokollieren Modellversion, Prompt, Einstellungen, Wiederholungen und Fehler. Ein separater Prüfsatz verhindert Optimierung nur auf bekannte Beispiele.

  4. 4

    Entscheidung übergeben

    Empfehlung mit Begründung, Kostenhochrechnung, Fehlerbeispielen und Grenzen. Wechseln, gezielt kombinieren oder beim bisherigen Modell bleiben: Das Ergebnis ist offen.

Ihre Entscheidungsvorlage.

Verständlich für die Geschäftsführung. Nachprüfbar für Ihr Engineering-Team.

Die Evaluation wird als eigenständige Leistung angeboten. Festpreis nach Sichtung von Aufgabe und Testset; Umfang, API-Budget und Liefertermin werden vor Beauftragung festgehalten. Eine anschließende Umsetzung ist optional.

Testvorhaben besprechen
Qualität und Fehler
Erfolgsquote mit Zähler und Nenner, Bewertung nach Rubrik und konkrete Fehlertypen. Fachliche Prüfung der Antworten; ein LLM-Judge ist höchstens unterstützend. Unsere Erfahrung aus der Cybersecurity hilft, beobachtete Schwächen und ihre Folgen für Ihren Einsatz einzuordnen.
Laufzeit und Stabilität
Ende-zu-Ende-Laufzeiten als Median und Streuung, Timeouts und Wiederholungen. Tail-Latenzen nur mit ausgewiesener Stichprobe und ausreichender Messbasis.
Kosten und Wirtschaftlichkeit
Input, Output, Cache und berechnetes Thinking gemäß Usage-Daten; Tools und Fehlversuche separat. Gesamtkosten geteilt durch akzeptierte Ergebnisse. Bei null Treffern: kein sinnvoller Stückpreis.
Prüfbare Unterlagen
Kompakte Entscheidungsvorlage, Vergleichstabelle als CSV, Testprotokoll und versionierte Konfiguration. Dazu eine Ergebnisbesprechung mit konkreten nächsten Schritten.

Vor dem ersten Test geklärt.

Anbieterneutral bedeutet: Die Anforderungen führen die Auswahl. Auch wenn wir mit einzelnen Anbietern zusammenarbeiten, entscheidet Ihr Testset über die Empfehlung.

Was passiert mit unseren Daten?

Wir vereinbaren zulässige Testdaten, Empfänger, Aufbewahrung und Löschung vor dem Start. Vertrauliche Inhalte werden nur in einer von Ihnen freigegebenen Umgebung verarbeitet. Für die erste Anfrage genügt eine Beschreibung ohne Kundendaten.

Sind Einsparungen garantiert?

Nein. Ein günstigeres Modell kann mehr Tokens oder Versuche brauchen oder an der Qualität scheitern. Wir rechnen mit Ihrem Volumen und berücksichtigen Wechselaufwand. Der Test kann auch bestätigen, dass Fable oder Opus für Ihre Aufgabe die wirtschaftlichere Wahl bleibt.

Wie aussagekräftig ist ein kleines Testset?

Es liefert eine erste Entscheidungsgrundlage für den abgegrenzten Anwendungsfall. Wir dokumentieren Stichprobe, Schwankungen und nicht getestete Fälle. Für seltene Fehler oder weitreichende Produktionsentscheidungen kann eine größere Folgemessung nötig sein.