Zum Inhalt

Modellvergleich auf Kundendaten.

Das richtige Modell für Ihre Aufgabe. Mit Zahlen, die Ihre Entscheidung tragen.

Wir vergleichen drei geeignete KI-Modelle mit einem kleinen Testset aus Ihrem Alltag: Qualität, Laufzeit und Kosten. Sie erhalten eine klare Empfehlung mit Messdaten und Grenzen – unabhängig vom Modellanbieter.

Modellkenntnis aus eigener Security-Praxis: Franz Bettag entwickelt eine Bug-Bounty-Plattform mit mehreren Modellfamilien. Seine Arbeit ist öffentlich belegt: #2 VDP Researcher Deutschland, Januar–März 2026. Workflow und Nachweis ansehen

Arbeitsplatz für den Vergleich von KI-Modellen
Arbeitsplatz für den Vergleich von KI-Modellen

Mehr Intelligenz pro Dollar.

17 Modelle, dazu die Reasoning-Stufen von OpenAI. Wählen Sie Anbieter und Einstellungen aus und entdecken Sie Kandidaten für einen Test mit Ihren Daten.

Intelligenz vs. TokenpreisWeiter oben: stärker im Benchmark. Weiter links: günstiger.
KI-Anbieter

35 Punkte im Diagramm · Preisachse bleibt unverändert

Keine Punkte für diese Auswahl.

Intelligence Index · v4.3.2 0 10 20 30 40 50 60 $0 $5 $10 $15 $20 Tokenpreis · USD / 1 Mio. · linear ab 0 Claude Fable 5.1 · max · default fallback · 53 · 20.00 USD Claude Fable 5.1 Claude Opus 5.5 · max · default fallback · 58 · 8.00 USD Claude Opus 5.5 Claude Opus 5 · max · 51 · 10.00 USD Claude Opus 5 Claude Sonnet 5 · max · 38 · 4.00 USD Claude Sonnet 5 Claude Haiku 4.5 · reasoning · 17 · 2.00 USD Claude Haiku 4.5 GPT-6 Astra · max · 53 · 20.00 USD GPT-6 Astra · max GPT-6 Astra · xhigh · 52 · 20.00 USD Astra · xhigh GPT-6 Astra · high · 51 · 20.00 USD Astra · high GPT-6 Astra · medium · 50 · 20.00 USD Astra · medium GPT-6 Astra · low · 46 · 20.00 USD Astra · low GPT-6 Sol · max · 48 · 4.00 USD GPT-6 Sol · max GPT-6 Sol · xhigh · 44 · 4.00 USD Sol · xhigh GPT-6 Sol · high · 43 · 4.00 USD Sol · high GPT-6 Sol · medium · 40 · 4.00 USD Sol · medium GPT-6 Sol · low · 34 · 4.00 USD Sol · low GPT-6 Sol · none · 28 · 4.00 USD Sol · none GPT-5.6 Terra · max · 42 · 4.50 USD GPT-5.6 Terra · max GPT-5.6 Terra · xhigh · 38 · 4.50 USD Terra · xhigh GPT-5.6 Terra · high · 34 · 4.50 USD Terra · high GPT-5.6 Terra · medium · 30 · 4.50 USD Terra · medium GPT-5.6 Terra · low · 27 · 4.50 USD Terra · low GPT-5.6 Terra · none · 21 · 4.50 USD Terra · none GPT-6 Luna · max · 37 · 0.20 USD GPT-6 Luna · max GPT-6 Luna · xhigh · 34 · 0.20 USD Luna · xhigh GPT-6 Luna · high · 32 · 0.20 USD Luna · high GPT-6 Luna · medium · 29 · 0.20 USD Luna · medium GPT-6 Luna · low · 21 · 0.20 USD Luna · low GPT-6 Luna · none · 18 · 0.20 USD Luna · none GLM-5.3 · max · 45 · 2.15 USD GLM-5.3 GLM-5.3 Flash · reasoning · 42 · 0.24 USD GLM-5.3 Flash Kimi K3 · max · 44 · 6.00 USD Kimi K3 MiniMax M3 · reasoning · 29 · 0.52 USD MiniMax M3 Qwen3.8 Max · reasoning · 45 · 3.00 USD Qwen3.8 Max Qwen3.7 Plus · reasoning · 25 · 0.70 USD Qwen3.7 Plus Claude Fable 5 · max · Opus 4.8 fallback · 50 · 20.00 USD Claude Fable 5 Intelligence Index · v4.3.2 0 10 20 30 40 50 60 $0 $5 $10 $15 $20 Tokenpreis · USD / 1 Mio. · linear ab 0 Claude Fable 5.1 · max · default fallback · 53 · 20.00 USD 1 Claude Opus 5.5 · max · default fallback · 58 · 8.00 USD 2 Claude Opus 5 · max · 51 · 10.00 USD 3 Claude Sonnet 5 · max · 38 · 4.00 USD 4 Claude Haiku 4.5 · reasoning · 17 · 2.00 USD 5 GPT-6 Astra · max · 53 · 20.00 USD 6 max GPT-6 Astra · xhigh · 52 · 20.00 USD 6 xhigh GPT-6 Astra · high · 51 · 20.00 USD 6 high GPT-6 Astra · medium · 50 · 20.00 USD 6 medium GPT-6 Astra · low · 46 · 20.00 USD 6 low GPT-6 Sol · max · 48 · 4.00 USD 7 max GPT-6 Sol · xhigh · 44 · 4.00 USD 7 xhigh GPT-6 Sol · high · 43 · 4.00 USD 7 high GPT-6 Sol · medium · 40 · 4.00 USD 7 medium GPT-6 Sol · low · 34 · 4.00 USD 7 low GPT-6 Sol · none · 28 · 4.00 USD 7 none GPT-5.6 Terra · max · 42 · 4.50 USD 8 max GPT-5.6 Terra · xhigh · 38 · 4.50 USD 8 xhigh GPT-5.6 Terra · high · 34 · 4.50 USD 8 high GPT-5.6 Terra · medium · 30 · 4.50 USD 8 medium GPT-5.6 Terra · low · 27 · 4.50 USD 8 low GPT-5.6 Terra · none · 21 · 4.50 USD 8 none GPT-6 Luna · max · 37 · 0.20 USD 9 max GPT-6 Luna · xhigh · 34 · 0.20 USD 9 xhigh GPT-6 Luna · high · 32 · 0.20 USD 9 high GPT-6 Luna · medium · 29 · 0.20 USD 9 medium GPT-6 Luna · low · 21 · 0.20 USD 9 low GPT-6 Luna · none · 18 · 0.20 USD 9 none GLM-5.3 · max · 45 · 2.15 USD 10 GLM-5.3 Flash · reasoning · 42 · 0.24 USD 11 Kimi K3 · max · 44 · 6.00 USD 12 MiniMax M3 · reasoning · 29 · 0.52 USD 13 Qwen3.8 Max · reasoning · 45 · 3.00 USD 14 Qwen3.7 Plus · reasoning · 25 · 0.70 USD 15 Claude Fable 5 · max · Opus 4.8 fallback · 50 · 20.00 USD 17

Zahl = Modell in der Legende · Text = Reasoning-Stufe

Claude Sonnet 5 2.00 USD Input / 10.00 USD Output je 1 Mio. Tokens Preis im Diagramm: 4.00 USD / 1M Index 38 · max Preisquelle Benchmark & Einstellungen

Mehr Reasoning verändert Tokenverbrauch und Laufzeit, nicht den Tarif je Token. Deshalb stehen die Stufen eines OpenAI-Modells senkrecht übereinander. Der Preis einer gelösten Aufgabe kann trotzdem stark variieren. Astra unterstützt low bis max; none zeigen wir für Sol, Terra und Luna. Reasoning und Abrechnung.

Lineare Preisachse ab 0: Doppelt so weit rechts bedeutet doppelt so teuer. Preismix: 75 % Input + 25 % Output, ohne Cache und Batch. Die tatsächlichen Tokens pro Aufgabe unterscheiden sich je Modell. Benchmark: Artificial Analysis Intelligence Index v4.3.2. Stand: .

Qwen3.8 Flash: 0,15 USD Input / 0,47 USD Output je Mio. Tokens; noch ohne verifizierten Indexwert. Qwen führt die API-Varianten Max, Plus und Flash. Die Qwen-Preise beziehen sich auf den Tarif International.

Teurer heißt nicht stärker.Opus 5.5 führt den Index mit 58 Punkten und kostet 8 USD je Mio. Tokens im 3:1-Mix. Fable 5.1 kostet 20 USD und erreicht 53 Punkte. Der stärkste Wert ist damit 60 % günstiger als der teuerste Tarif. Sonnet 5 liegt bei 4 USD und 38 Punkten.

Der Test entscheidet.GLM-5.3 Flash liegt im selben Preismix bei rund 0,24 USD. Ob ein günstigeres Modell Ihre Aufgabe zuverlässig löst, prüfen wir mit Ihren Daten und klaren Abnahmekriterien.

Alle Tokenpreise und Ihr Monatsvolumen berechnen

Bitte ganze Zahlen ab 0 eingeben: maximal 1 Milliarde Aufgaben, 256.000 Input- und 2 Millionen Output-Tokens.

USD je 1 Mio. Tokens · ein Aufruf pro Aufgabe · Output inklusive berechnetem Thinking
Modell Input Output Monatskosten Quelle
Claude Fable 5.1 10.00 USD 50.00 USD 450.00 USD Preisliste: Claude Fable 5.1
Claude Opus 5.5 4.00 USD 20.00 USD 180.00 USD Preisliste: Claude Opus 5.5
Claude Opus 5 5.00 USD 25.00 USD 225.00 USD Preisliste: Claude Opus 5
Claude Sonnet 5 2.00 USD 10.00 USD 90.00 USD Preisliste: Claude Sonnet 5
Claude Haiku 4.5 1.00 USD 5.00 USD 45.00 USD Preisliste: Claude Haiku 4.5
GPT-6 Astra 10.00 USD 50.00 USD 450.00 USD Preisliste: GPT-6 Astra
GPT-6 Sol 2.00 USD 10.00 USD 90.00 USD Preisliste: GPT-6 Sol
GPT-5.6 Terra 2.00 USD 12.00 USD 100.00 USD Preisliste: GPT-5.6 Terra
GPT-6 Luna 0.10 USD 0.50 USD 4.50 USD Preisliste: GPT-6 Luna
GLM-5.3 1.40 USD 4.40 USD 50.00 USD Preisliste: GLM-5.3
GLM-5.3 Flash 0.15 USD 0.50 USD 5.50 USD Preisliste: GLM-5.3 Flash
Kimi K3 3.00 USD 15.00 USD 135.00 USD Preisliste: Kimi K3
MiniMax M3 0.30 USD 1.20 USD 12.00 USD Preisliste: MiniMax M3
Qwen3.8 Max 2.00 USD 6.00 USD 70.00 USD Preisliste: Qwen3.8 Max
Qwen3.7 Plus 0.40 USD 1.60 USD 16.00 USD Preisliste: Qwen3.7 Plus
Qwen3.8 Flash 0.15 USD 0.47 USD 5.35 USD Preisliste: Qwen3.8 Flash
Claude Fable 5 10.00 USD 50.00 USD 450.00 USD Preisliste: Claude Fable 5

Monatskosten = Aufgaben × (Input-Tokens × Inputpreis + Output-Tokens × Outputpreis) ÷ 1.000.000. Ohne Cache, Batch, Tools, Steuern und Sonderverträge. Eine Preisrechnung, keine Modellaufrufe oder Prüfung von Modelllimits.

Tarifdetails: OpenAI weist für GPT-6 und GPT-5.6 getrennte Preise für kurzen und langen Kontext aus; wir zeigen den Tarif für kurzen Kontext. Qwen3.7 Plus zeigt den regulären Preis der Version 2026-05-26 bis 256K Input-Tokens. MiniMax M3: Standardtarif bis 512K. Größere Kontexte können teurer sein.

Gleicher Text bedeutet nicht gleiche Tokenzahl. Tokenisierung, Thinking, Antwortlänge und Wiederholungen unterscheiden sich. Im Kundentest messen wir deshalb Kosten je akzeptiertem Ergebnis mit den tatsächlich abgerechneten Tokens. Der allgemeine Benchmark ersetzt diese Prüfung nicht.

Modellkenntnis aus echter Security-Arbeit.

Recherche. Gegenprüfung. Belastbare Belege. Genau dort lernen wir die Stärken und Fehlergrenzen von Modellen kennen.

#2

VDP Researcher Deutschland

HackerOne · Januar–März 2026

Franz Bettags eigene Bug-Bounty-Plattform verbindet spezialisierte Agenten mit getrennten Recherche- und Prüfphasen. Die Konfiguration umfasst sechs Modellfamilien: OpenAI, Claude, GLM, Kimi, MiniMax und DeepSeek. Das Modellprofil lässt sich je Phase wählen.

Diese Praxis fließt in Ihren Vergleich ein: Aufgaben sinnvoll aufteilen, Ergebnisse gegenprüfen und Fehlversuche mitbewerten.

Ergänzend dokumentieren die Anthropic-Kurszertifikate die Weiterbildung zu Claude, APIs und Agenten. Kursnachweise ansehen

Die Bug-Bounty-Fallstudie
Historischer HackerOne-Ranking-Screenshot: fbettag auf Platz 2 mit Signal 7.00.
Historischer Screenshot aus dem Vortrag vom 16. April 2026. Zeitraum und Kategorie sind auf der Veranstaltungsseite dokumentiert. Veranstaltungsnachweis · Vortrag

Kleines Testset. Belastbare Entscheidung.

Ein abgegrenzter Anwendungsfall reicht für den Einstieg: etwa Support-Antworten, Dokumentenextraktion, Klassifikation oder Zusammenfassungen. Wir testen, was Ihr Betrieb tatsächlich braucht.

  1. 1

    Aufgabe und Abnahme festlegen

    Typischer Start: 30–50 repräsentative Beispiele inklusive Randfällen, Referenzantworten und klarer Bewertungsrubrik. Unsere Security-Erfahrung hilft, gezielt auch widersprüchliche Anweisungen und manipulierte Inhalte als Testfälle einzubeziehen, wo sie für Ihre Anwendung relevant sind. Auswahl und Umfang vereinbaren wir vorab.

  2. 2

    Drei Modelle auswählen

    Passend zu Aufgabe, Sprache, Datenfreigabe und Budget. Ihr heutiges Modell kann die Baseline sein. Die Auswahl erfolgt anbieterneutral; ein günstiger Kandidat muss fachlich geeignet sein.

  3. 3

    Vergleichbar messen

    Gleiches Testset und gleiche Abnahmekriterien. Wir protokollieren Modellversion, Prompt, Einstellungen, Wiederholungen und Fehler. Ein separater Prüfsatz verhindert Optimierung nur auf bekannte Beispiele.

  4. 4

    Entscheidung übergeben

    Empfehlung mit Begründung, Kostenhochrechnung, Fehlerbeispielen und Grenzen. Wechseln, gezielt kombinieren oder beim bisherigen Modell bleiben: Das Ergebnis ist offen.

Ihre Entscheidungsvorlage.

Verständlich für die Geschäftsführung. Nachprüfbar für Ihr Engineering-Team.

Die Evaluation wird als eigenständige Leistung angeboten. Festpreis nach Sichtung von Aufgabe und Testset; Umfang, API-Budget und Liefertermin werden vor Beauftragung festgehalten. Eine anschließende Umsetzung ist optional.

Testvorhaben besprechen
Qualität und Fehler
Erfolgsquote mit Zähler und Nenner, Bewertung nach Rubrik und konkrete Fehlertypen. Fachliche Prüfung der Antworten; ein LLM-Judge ist höchstens unterstützend. Unsere Erfahrung aus der Cybersecurity hilft, beobachtete Schwächen und ihre Folgen für Ihren Einsatz einzuordnen.
Laufzeit und Stabilität
Ende-zu-Ende-Laufzeiten als Median und Streuung, Timeouts und Wiederholungen. Tail-Latenzen nur mit ausgewiesener Stichprobe und ausreichender Messbasis.
Kosten und Wirtschaftlichkeit
Input, Output, Cache und berechnetes Thinking gemäß Usage-Daten; Tools und Fehlversuche separat. Gesamtkosten geteilt durch akzeptierte Ergebnisse. Bei null Treffern: kein sinnvoller Stückpreis.
Prüfbare Unterlagen
Kompakte Entscheidungsvorlage, Vergleichstabelle als CSV, Testprotokoll und versionierte Konfiguration. Dazu eine Ergebnisbesprechung mit konkreten nächsten Schritten.

Vor dem ersten Test geklärt.

Anbieterneutral bedeutet: Die Anforderungen führen die Auswahl. Auch wenn wir mit einzelnen Anbietern zusammenarbeiten, entscheidet Ihr Testset über die Empfehlung.

Was passiert mit unseren Daten?

Wir vereinbaren zulässige Testdaten, Empfänger, Aufbewahrung und Löschung vor dem Start. Vertrauliche Inhalte werden nur in einer von Ihnen freigegebenen Umgebung verarbeitet. Für die erste Anfrage genügt eine Beschreibung ohne Kundendaten.

Sind Einsparungen garantiert?

Nein. Ein günstigeres Modell kann mehr Tokens oder Versuche brauchen oder an der Qualität scheitern. Wir rechnen mit Ihrem Volumen und berücksichtigen Wechselaufwand. Der Test kann auch bestätigen, dass Fable oder Opus für Ihre Aufgabe die wirtschaftlichere Wahl bleibt.

Wie aussagekräftig ist ein kleines Testset?

Es liefert eine erste Entscheidungsgrundlage für den abgegrenzten Anwendungsfall. Wir dokumentieren Stichprobe, Schwankungen und nicht getestete Fälle. Für seltene Fehler oder weitreichende Produktionsentscheidungen kann eine größere Folgemessung nötig sein.

Welches Modell passt zu Ihren Daten?

Wir definieren gemeinsam Testfälle, Qualitätsmaßstäbe und Betriebsgrenzen für Ihren Anwendungsfall.

Modellvergleich für Ihr Projekt besprechen

Security-Anfrage

Unverbindlich anfragen: Pentest-Paket oder individuelles Reverse Engineering. Prüfumfang, Starttermin und Konditionen stimmen wir persönlich mit Ihnen ab.

Pentest-Preise netto pro Monat. Alle Preise sind Einstiegspreise. Der endgültige Monatspreis richtet sich nach Anzahl und Umfang der vereinbarten Scopes und kann entsprechend höher liegen. Den verbindlichen Preis erhalten Sie im Angebot.

Bis 30. September 2026 beauftragen. 30 % Preisvorteil sichern. Für Pentest-Pakete und individuelles Reverse Engineering bei Beauftragung bis einschließlich 30. September 2026 (Europe/Berlin). Der Preisvorteil gilt über die gesamte vereinbarte Vertragslaufzeit. Den Projektstart stimmen wir unabhängig davon ab. Die Konditionen bestätigen wir im Angebot.

Bitte keine Passwörter, Zugangsdaten, vertraulichen Schwachstellendetails oder Firmware-Dateien senden. Den sicheren Austausch und die Testfreigabe vereinbaren wir persönlich.

Datenschutzhinweise

Diese Anfrage ist keine Beauftragung und sichert keine Aktionskonditionen. Bitte bestätigen Sie nach dem Absenden Ihre E-Mail-Adresse.