Anoni

Benchmark · run du 18 juin 2026

Mesuré, pas promis.

210 documents juridiques français synthétiques (conclusions, factures, courriers RH) passés dans Anoni et trois détecteurs publics. Mêmes documents, même règle de mesure, graine fixée. Le test se rejoue à l’identique.

Rappel strict

Anoni (modèles + règles)
94,8 %
openai/privacy-filter (brut)
67,8 %
Microsoft Presidio (fr)
58,6 %
AInonymizer
64,4 %
Anoni (règles seules)
59,3 %
Part des données trouvées avec la bonne catégorie · run officiel du 18 juin 2026, 210 documents juridiques FR synthétiques.
SystèmeRappel strictFuites évitéesFaux positifs
Anoni (modèles + règles)94,8 %99,0 %73
openai/privacy-filter (brut)67,8 %91,9 %217
Microsoft Presidio (fr)58,6 %77,1 %356
AInonymizer64,4 %67,9 %143
Anoni (règles seules)59,3 %65,2 %0

Run officiel du 18 juin 2026 · Apple M5 Pro, 24 Go, MPS, sur 210 documents. « Rappel strict » : la donnée est trouvée avec la bonne catégorie (recouvrement ≥ 66 %). « Fuites évitées » : part des caractères sensibles couverts par une détection, toutes catégories confondues. « Faux positifs » : détections sur du texte qui n’est pas une donnée personnelle. Anoni en a le moins (73) des détecteurs à modèle, donc il sur-caviarde le moins. C’est ce qui compte avant d’envoyer un texte à une IA.

Plonger dans le détail

Rappel par catégorie, chaque système

Le banc, catégorie par catégorie. La barre pleine, c’est Anoni ; la barre fine, le meilleur concurrent sur cette ligne. L’écart se creuse là où il faut comprendre le contexte : lieux, téléphones, personnes. Sur les identifiants à clé de contrôle, presque tout le monde plafonne.

Anoni meilleur concurrent
Personnes
99,6 %Presidio 94,5 %
Adresses
86,7 %AInonymizer 81,9 %
Lieux
94,3 %privacy-filter 51,1 %
Courriels
100,0 %Presidio 100,0 %
Téléphones
100,0 %Presidio 88,6 %
Dates
100,0 %AInonymizer 100,0 %
NIR
98,6 %privacy-filter 100,0 %
SIRET / SIREN
100,0 %privacy-filter 90,7 %
IBAN
100,0 %AInonymizer 100,0 %
Organisations
75,7 %AInonymizer 53,7 %

La barre pleine en noir, c’est Anoni ; la barre fine en dessous, le meilleur concurrent. Détection parfaite (100 %) sur : Courriels · Téléphones · Dates · SIRET / SIREN · IBAN. Les identifiants français sont validés clé de contrôle comprise, pas devinés au motif.

Le rappel « organisations » est le plus bas, mais c’est une question d’étiquette, pas une fuite : les noms d’entreprise sont parfois caviardés comme des personnes. La donnée reste retirée. Les organisations sont couvertes à 96,4 %.

La méthode, honnêtement

Les documents sont synthétiques. Générés depuis six gabarits juridiques réalistes, avec identifiants français valides (NIR, SIRET, IBAN aux clés de contrôle correctes) et vérité terrain enregistrée à la génération. Chaque système est mesuré tel que livré, réglages par défaut, versions épinglées. Aucun document réel n’a servi au test. Donc aucune donnée personnelle.

Un banc synthétique a ses limites. Il mesure la détection sur des structures de documents connues, pas la variété infinie du réel. C’est aussi ce qui le rend reproductible. Le jeu d’essai et le détail de la mesure seront publiés. D’ici là, les chiffres se vérifient sur demande : contact@anoni.dev.

Une honnêteté de plus. La première exécution du banc a révélé un défaut dans notre propre moteur : un SIRET pouvait masquer un NIR sous la mauvaise étiquette. Corrigé, re-mesuré, publié. C’est exactement à ça que sert un banc d’essai.

Et sur des données qu’on n’a pas écrites

Un banc synthétique reste notre banc. Alors Anoni est aussi mesuré sur un corpus indépendant : ai4privacy OpenPII. De la donnée personnelle française annotée à la main, sous licence libre (CC-BY). 500 documents que nous n’avons pas écrits.

Sur le champ français d’Anoni (personnes, adresses, lieux, courriels, téléphones, dates) : 92,7 % de rappel strict et 97,1 % des caractères sensibles couverts. Une mesure indépendante. La réponse honnête à « oui, mais c’est votre propre jeu d’essai ».

Le corpus n’étiquette pas les organisations et mêle des identifiants non français (cartes, passeports) hors du champ d’Anoni. Le chiffre porte donc sur les catégories qu’Anoni cible. Reproductible, comme le reste.

Domaine médical

Et sur des documents de santé

Comptes rendus d’hospitalisation, ordonnances, courriers de spécialiste. Les dossiers médicaux réels ne sont jamais publics, et c’est exactement pour ça qu’ils doivent rester sur la machine. Faute de corpus public, le banc médical est synthétique : 105 documents, même règle de mesure.

Anoni (modèles + règles)
91,4 %
openai/privacy-filter (brut)
73,6 %
Microsoft Presidio (fr)
55,1 %
AInonymizer
55,9 %
Anoni (règles seules)
71,4 %
Rappel strict sur 105 documents médicaux FR synthétiques · run du 18 juin 2026.

Le numéro de sécurité sociale (carte Vitale), les noms de patients et de médecins, les dates : tous détectés. Et surtout le numéro de dossier (IPP), l’identifiant propre à l’hôpital, qu’Anoni couvre à 100,0 % là où la plupart des outils le laissent en clair.

Les modèles publics de désidentification médicale sont anglophones et sous accès contrôlé. Le banc médical d’Anoni est donc synthétique et reproductible, comme le banc juridique.

Voir aussi : conformité · pour les avocats · télécharger.