Benchmarks

Wir messen, statt zu behaupten. Jede Zahl auf dieser Seite stammt aus einem protokollierten Messlauf auf demselben deutschen Gold-Korpus und trägt ihr Messdatum. Was wir nicht gemessen haben, steht hier nicht.

Stand: 16.08.2026 · This page in English →

Freie PII-Engines im Vergleich (Standalone)

Vier frei verfügbare Erkennungs-Systeme und die Saklam Bridge, jeweils standalone auf demselben Korpus, dieselbe Metrik. Kommerzielle Anbieter benennen wir hier bewusst nicht — verglichen wird nur, was jeder selbst kostenlos nachstellen kann.

Systemerkannt (von 489)Quotegemessen am
Saklam Bridge v0.2.1748298,6 %16.08.2026
Saklam Bridge v0.2.1046695,3 %17.07.2026
OpenAI Privacy-Filter39981,6 %17.07.2026
GLiNER2-PII (Fastino, Threshold 0,3)34871,2 %17.07.2026
Microsoft Presidio + spaCy de_core_news_lg34570,6 %17.07.2026
Kiji (Dataiku)22245,4 %29.07.2026 *

* Nachmessung mit identischem Korpus und identischer Metrik. Presidio und Kiji jeweils im Standard-Setup gemessen — beide Produkte erlauben eigene Zusatz-Recognizer bzw. Regex-Regeln (dann übernimmt man die Pattern-Pflege selbst).
Zwischenstand derselben Reihe: Bridge v0.2.12 misst auf demselben Korpus 467/489 = 95,5 % (22.07.2026). Der Zuwachs bis v0.2.17 kommt aus einer deterministischen Zusatzschicht für Referenz- und Vorgangsnummern, Organisationsnamen und Titelketten — kein neues Modell, kein Nachtunen auf den Korpus.

Fairerweise: was die anderen gut können

  • GLiNER2-PII lieferte das beste Adress-Ergebnis des Feldes (98 % vs. 94 % bei Saklam) und war stark bei Mitarbeiter- und Kunden-IDs.
  • Der OpenAI-Filter war stark bei Personennamen und Secrets — im Erstlauf schlug er unsere damalige Version bei Personennamen. Die Befunde flossen noch am selben Tag in v0.2.10 (Personennamen danach 93 %).
  • Kiji (Apache 2.0) war fehlerfrei bei E-Mail-Adressen (53/53) und stark bei Steuer-IDs (90 %) und IBANs (88 %) — die Lücken liegen im Label-Schema, das deutsche Fach-Identifikatoren (Aktenzeichen, Gerichte, Mandantennummern, Register) nicht kennt.
  • Gemeinsame Lücke der freien Engines ist die deutsche Struktur-Realität: Organisationen, Gerichte, Aktenzeichen, Steuer-IDs, gruppierte IBANs.
  • Auch bei Saklam bleiben Lücken — 23 der 489 Werte (Stand 17.07.) haben wir bewusst nicht auf den Korpus wegoptimiert: kontextlose Kurz-IDs gehören in die Custom-Konfiguration des Kunden, seltene ausländische Namensformen sind eine Modellgrenze, an der wir arbeiten. Kein Benchmark-Overfitting. Stand 16.08. sind es 7 — sämtlich Personennamen ohne Kontext-Anker: bloße Nachnamen, Benutzerkennungen, seltene ausländische Namensformen.

Laufende Serie — neueste Messungen

Neu erscheinende Modelle messen wir laufend als NER-Komponente in der Saklam-Pipeline: gleicher Korpus, gleiche Regex-Schicht, identische Thresholds. Die Werte dieser Serie sind untereinander vergleichbar — aber nicht mit der Standalone-Tabelle oben: dort läuft z. B. GLiNER2 ohne unsere Pipeline (71,2 %), hier als Komponente darin (95,1 %). Deshalb trägt jede Zeile ihr Messdatum, und wir mischen nie Zahlen verschiedener Messstände in einer Vergleichszeile.

Modell (als NER-Komponente in der Saklam-Pipeline)erkannt (von 489)Quotegemessen am
Saklam Engine (Produktionsstand) — Referenz46795,5 %07.08.2026
SauerkrautLM-LFM2.5-GLiNER (VAGO Solutions, 411M)46695,3 %09.08.2026
GLiNER2-PII (Fastino)46595,1 %07.08.2026
gliner-pii-edge v1.0 (Knowledgator, 86 MB fp16)39881,4 %07.08.2026
  • SauerkrautLM-LFM2.5-GLiNER (09.08.): knapp unter der Referenz, mit einer echten Stärke — das Modell ist formatsensitiv bei strukturierten IDs (Kunden-, Personal-, Mandanten-Nummern) und erkennt Formate, die andere Kandidaten der Serie verfehlen.
  • GLiNER2-PII (07.08.): in der Pipeline nahe an der Referenz; einzelne zusätzliche Lücken bei Personennamen.
  • gliner-pii-edge (07.08.): sehr klein und rund 7× schneller — aber mit systematischen Lücken bei Personennamen. Geschwindigkeit ist billig, Recall nicht.

Methodik

  • Korpus: deutschsprachiger Gold-Korpus, 489 annotierte PII-Vorkommen in 48 synthetischen, realitätsnahen Dokumenten — Mandantenschreiben, Personalfälle, Rechnungen, Support-Tickets, Log-Auszüge. Vollständig synthetisch: keine echten personenbezogenen Daten.
  • Wertung: streng wertbasiert — ein annotierter Wert gilt nur dann als geschützt, wenn er im maskierten Output nicht mehr vorkommt, auch nicht teilweise als Substring. Über-Maskierung zählt nicht als Fehler, Teil-Leak zählt als Leak.
  • Vergleichbarkeit: innerhalb jeder Messreihe identische Pipeline, identische Thresholds, identischer Korpus. Kein Nachtunen auf den Korpus („Benchmark-Overfitting-Verbot").
  • Erkennungs-Stack Saklam: 350+ geprüfte PII-Muster (EU-27 + EWR) kombiniert mit einem NER-Modell — die Zahlen oben messen immer die Kombination, nicht ein Teilstück.

Warum der Korpus nicht öffentlich ist

Die naheliegende Frage: „Zeigt her den Korpus." Die ehrliche Antwort: Ein Gold-Korpus voller realistischer deutscher PII-Muster — Namen, IBANs, Aktenzeichen, Personalnummern in echt wirkenden Dokumenten — wäre selbst genau das Artefakt, vor dem diese Engine schützt. Ihn zu veröffentlichen hieße außerdem, dass jede Engine (unsere eingeschlossen) auf den Testsatz optimieren könnte — dann misst er nichts mehr. Stattdessen: Die Dokumente sind nach dem Muster der folgenden Beispiele gebaut (neu konstruiert, nicht aus dem Korpus kopiert), und die Live-Demos unten lassen jeden mit eigenem Text nachmessen.

Beispiel 1 — Mandantenschreiben:

Vorher
Sehr geehrte Frau Kollegin Dr. Wenkstern, in der Sache unseres Mandanten
Halil Demirbaş (Az. 4 O 2231/26) übersenden wir den Vergleichsvorschlag.
Die Zahlung über 4.850 € geht auf das Konto DE21 3704 0044 0532 0130 87.
Rückfragen gern an h.demirbas@web.de.
Nachher (maskiert)
Sehr geehrte Frau Kollegin Dr. [PER_9c41f2ab], in der Sache unseres Mandanten
[PER_5e17d803] (Az. [CAS_7d21e0a3]) übersenden wir den Vergleichsvorschlag.
Die Zahlung über 4.850 € geht auf das Konto [IBA_2f90c6d4].
Rückfragen gern an [EMA_b34a9e01].

Beispiel 2 — Personalfall:

Vorher
Mitarbeiterin Annika Brendel hat zum 31.10. gekündigt. Bitte formuliere
ein wohlwollendes Zwischenzeugnis, Abteilung Vertrieb Süd,
Vorgesetzter: Timo Kaltenbach.
Nachher (maskiert)
Mitarbeiterin [PER_41d8e07f] hat zum 31.10. gekündigt. Bitte formuliere
ein wohlwollendes Zwischenzeugnis, Abteilung Vertrieb Süd,
Vorgesetzter: [PER_c290ab54].

Beispiel 3 — Rechnung:

Vorher
Rechnung an Brandt & Cie. Steuerberatung, z. Hd. Frau Melisa Yavuz,
USt-IdNr. DE314592807 — bitte prüfe die Positionen auf Plausibilität.
Nachher (maskiert)
Rechnung an [ORG_88f1c3d2], z. Hd. Frau [PER_67ab04e9],
USt-IdNr. [VAT_d10c58fa] — bitte prüfe die Positionen auf Plausibilität.

Alle Beispiele neu konstruiert im Stil des Korpus; sämtliche Namen, IBANs und Kennungen sind erfunden, Platzhalter-IDs beispielhaft. Beachte, was nicht maskiert wird: Beträge, Fristen, der Sachverhalt — das ist die Nutzlast, die das Modell zum Arbeiten braucht. Maskiert wird, was die Anfrage einer Person oder Firma zuordenbar macht.

Selbst nachmessen

Du musst uns nicht glauben. Dieselbe Erkennung läuft in unseren Live-Demos direkt im Browser — eigener Text rein, Ergebnis Zeile für Zeile ansehen:

Oder direkt im Chat-Fenster: Saklam-Browser-Extension für ChatGPT & Co. →