Zum Inhalt

Bug-Bounty-Hunting mit mehreren KI-Modellen

Franz Bettag entwickelt und betreibt eine eigene Plattform für KI-gestützte Sicherheitsforschung. Sie verbindet spezialisierte Agenten, eine Modellwahl pro Arbeitsphase und die erneute Prüfung von Befunden. Seine Security-Praxis ist öffentlich belegt: #2 VDP Researcher für Deutschland auf HackerOne, Januar–März 2026.

Historischer HackerOne-Ranking-Screenshot: fbettag auf Platz 2, Reputation 21 und Signal 7.00.
Ranking-Screenshot aus dem Vortrag vom 16. April 2026. Die Veranstaltungsseite ordnet die Platzierung Deutschland und dem Zeitraum Januar–März 2026 zu. Veranstaltungsnachweis

Problem

Ein Verdacht ist noch kein Befund

KI kann große Codebestände und Angriffsflächen untersuchen. Dabei entstehen auch plausible, aber falsche Behauptungen. Für einen belastbaren Report braucht es einen erlaubten Scope, eine reproduzierbare Schwachstelle und nachgewiesene Auswirkungen. Recherche, Gegenprüfung und Dokumentation stellen unterschiedliche Anforderungen an ein Modell.

Rolle

Entwicklung und Betrieb

Franz Bettag konzipiert, entwickelt und betreibt die Plattform für seine eigene Bug-Bounty-Arbeit: Backend und CLI, Agentenwerkzeuge, Phasenprompts, Modellprofile und NixOS-Konfiguration. Er legt die Arbeitsweise fest und bewertet die Ergebnisse aus seiner Praxis als Security Researcher.

Architektur und Modellwahl

Gemeinsamer Zustand, verteilte Arbeit

Ein Go-Backend hält Kampagnen, Befunde, Einreichungen und Läufe zentral vor. Worker arbeiten über eine gemeinsame CLI mit dieser API. NixOS beschreibt die Infrastruktur. Jeder Lauf lässt sich seinem Modellprofil, Start- und Endzeitpunkt sowie Status zuordnen; Artefakte wie Logs und Screenshots werden mit Laufbezug und SHA-256-Prüfsumme erfasst.

Sechs Modellfamilien

Die geprüfte Konfiguration enthält Modelle aus den Familien OpenAI GPT/Codex, Anthropic Claude, GLM, Kimi, MiniMax und DeepSeek. Im Launcher wird das Modellprofil für jede Phase separat gewählt. So können Recherche und Gegenprüfung mit unterschiedlichen Modellen laufen. Die Auswahl bleibt steuerbar; ein automatisches Ranking des besten Modells pro Aufgabe ist damit nicht verbunden.

Der tatsächliche KI-Workflow

1 · Hunt

Spezialisierte Agenten untersuchen den gewählten Scope. Plattformbezogene Prompts berücksichtigen den jeweiligen Meldeweg. Befunde und Belege werden für die nächsten Phasen gespeichert.

2 · Triage

Die Phasenprompts verlangen eine erneute praktische Reproduktion. Ein Befund wird als reportable, needs-review oder false-positive eingeordnet. Unklare oder instabile Ergebnisse sollen zur Prüfung zurückgehen; eine Modellbehauptung allein reicht nicht als Beleg.

3 · Chain

Bestätigte Befunde werden auf zusammenhängende Auswirkungen geprüft und zu Report-Entwürfen aufbereitet. Die Vorgaben schließen rein theoretische Ketten und Aussagen außerhalb des Scopes aus.

4 · Submit und Feedback

Die QA-Vorgaben verlangen nochmals reproduzierbare Belege, passende Anhänge und eine durch den gezeigten Impact begründete Bewertung. Entwürfe erhalten ready oder needs-revision. Rückmeldungen fließen in weitere Bearbeitungsschritte ein.

Ergebnisse und Einordnung

#2 VDP Researcher Deutschland

Die öffentliche Veranstaltungsseite bestätigt Platz 2 für Januar–März 2026. Der historische Ranking-Screenshot zeigt fbettag mit Signal 7.00 und 21 Reputation-Punkten in dieser Ansicht. Das ist eine Platzierung in der Vulnerability-Disclosure-Kategorie, kein globaler Rang und keine Rangliste nach ausgezahlten Bounties.

Was daraus für Ihren Modellvergleich folgt

Diese Arbeit liefert Erfahrung mit Modellverhalten bei langen Werkzeugabläufen, Gegenprüfungen und widersprüchlichen Ergebnissen. Für Ihren Einsatz übersetzen wir das in konkrete Testfälle, überprüfbare Qualitätskriterien und eine Messung der Kosten pro akzeptiertem Ergebnis. Welches Modell gewinnt, entscheidet Ihr Testset.

Stand der technischen Beschreibung

Architektur, Phasenvorgaben und Modellkonfiguration wurden am 7. September 2026 anhand des eigenen Quellcodes geprüft. Dieser Stand ist vom historischen Ranking zu unterscheiden. Eine gemessene Einsparquote, Annahmequote aller Reports oder ein ursächlicher Anteil einzelner Modelle an der Platzierung wird hier nicht behauptet.