Benchmark — wir zeigen unsere Zahlen

Kein Security-Scanner ist perfekt. Die meisten Anbieter sagen das nicht. Wir messen uns öffentlich — mit allen Schwächen.

Das Wichtigste zuerst: Gegen ein externes, unabhängiges Testset (deepset/prompt-injections, 546 Fälle) erreicht ClawGuard derzeit 100 % Precision (null Fehlalarme) und 24,6 % Recall. Beides hat eine klare Erklärung — und beides zeigen wir hier offen.

Die Zahlen (Stand 27.07.2026)

TestsetFällePrecisionRecallEinordnung
Intern v2 (eigene 20 Fälle, 5 Sprachen)2092,3 %100 %Nach Gap-Patch gegen die gefundenen Lücken
Extern: deepset/prompt-injections546100 %24,6 %Die ehrliche Außenwirkung
Extern: Lakera PINTfolgt (Zugang beantragt)

Was Precision 100 % bedeutet

Von 343 alltäglichen, harmlosen Texten (Fragen zu Programmierung, Reisen, Büchern) hat ClawGuard keinen einzigen fälschlich als Angriff markiert. Zum Vergleich: Eine aktuelle akademische Studie (MCPZoo, 2026) misst bei Security-Scannern im Schnitt nur 45,5 % Precision. Für Sie heißt das: Unsere Befunde haben Aussagekraft — wenn ClawGuard schlägt, ist es echt.

Was Recall 24,6 % bedeutet (und warum wir es trotzdem zeigen)

Von 203 echten Angriffen im externen Set erkennt unser regelbasierter Kern etwa ein Viertel. Das ist die ehrliche Grenze deterministischer Mustererkennung: Rollenspiel-Jailbreaks (z. B. „Spielen wir einen Film"), semantische Manipulation und indirekte Kontext-Vergiftung sind mit regulären Ausdrücken strukturell nicht fassbar — dafür braucht man Modell-Verständnis.

Drei Antworten darauf:

Warum deterministisch überhaupt?

Weil die Alternative — ein LLM, das LLM-Angriffe bewertet — ein Zirkelproblem ist: Der Prüfer ist selbst angreifbar. Unser Kern ist regelbasiert, offline, reproduzierbar: 236 Muster, 9 Kategorien, 14 Sprachen, gleicher Input = gleicher Befund. Für Ihre Dokumentation (EU AI Act) zählt genau das: wiederholbare, nachprüfbare Befunde.

Methodik

Interne Sets: kuratiert von uns (ehrlich: darauf ausgelegt, unsere Stärken zu prüfen — deshalb zählt die externe Zahl mehr). Externes Set: deepset/prompt-injections (HuggingFace, 546 Fälle, unverändert). Alle Läufe offline, reproduzierbar. Keine F1-Optimierung für Marketing — wir zeigen Precision und Recall getrennt, weil beide zusammen oft verschleiern.