Une personne assise à un bureau avec plusieurs écrans affichant du code et des cartes, travaillant dans un bureau faiblement éclairé, le visage flou, avec une tasse à proximité.

Automatiser le floutage des visages et des plaques d’immatriculation via API REST et Docker : pipelines par lots pour les équipes à fort volume

Mateusz Zimoch
Publié: 05/09/2026
Mis à jour: 24/09/2026

En bref : dès que le volume d’anonymisation dépasse quelques centaines de fichiers par mois, le principal goulot d’étranglement n’est plus la vitesse de détection, mais la conception des files d’attente, les nouvelles tentatives et les contrôles qualité. Gallio PRO propose un conteneur Docker, une interface en ligne de commande Linux et une API REST avec l’offre Enterprise, afin d’intégrer l’anonymisation à votre propre pipeline. Cet article s’adresse aux ingénieurs MLOps, aux équipes plateforme et aux responsables de jeux de données qui construisent ce type de pipeline.

Trois signes que l’application de bureau ne passe plus à l’échelle

Tout processus d’anonymisation commence de la même manière : une personne ouvre un fichier, le traite, le vérifie et l’exporte. Cela fonctionne, jusqu’à ce que trois symptômes apparaissent simultanément.

La file d’attente repose sur une personne. Le travail arrive plus vite qu’un opérateur ne peut le traiter, et les priorités se trouvent dans la boîte de réception de quelqu’un plutôt que dans un système.

Il n’y a pas de reprise sur échec. Une tâche qui échoue à 80 % du traitement d’un fichier de quatre heures est relancée manuellement, depuis le début, par la personne qui s’en aperçoit.

Il n’y a pas de traçabilité. Personne ne peut indiquer quels fichiers ont été traités au trimestre précédent, avec quels paramètres et qui a validé l’exportation. Il s’agit d’abord d’un problème de responsabilité avant d’être un problème d’ingénierie, car l’article 5, paragraphe 2, du RGPD impose au responsable du traitement de pouvoir démontrer sa conformité, et non simplement de l’atteindre.

Des personnes travaillent dans une salle de contrôle, utilisant plusieurs écrans et équipements électroniques, concentrées sur la surveillance de différentes affichages numériques.

Deux modèles d’intégration

Modèle A : dossier surveillé et conteneur

Les fichiers sont déposés dans un répertoire d’ingestion. Un conteneur les récupère, les traite, écrit les fichiers de sortie dans un répertoire distinct, puis déplace les sources vers une zone d’attente. La planification est gérée par cron, systemd ou votre orchestrateur.

Cette approche convient aux équipes disposant de fenêtres de traitement par lots prévisibles, par exemple une exécution nocturne sur les exports caméra de la journée. C’est le modèle qui demande le moins d’efforts et ne nécessite aucun développement applicatif. Gallio PRO le prend en charge via le conteneur Docker et l’interface en ligne de commande Linux disponibles avec l’offre Enterprise.

Modèle B : API REST appelée par votre système

Votre système de gestion des dossiers, votre plateforme de gestion des preuves ou votre outil d’annotation de données soumet une tâche et récupère le résultat traité. Le floutage automatisé devient une étape d’un flux de travail existant, plutôt qu’un outil distinct dont un utilisateur doit penser à se servir.

Cette approche convient aux équipes pour lesquelles l’anonymisation est déclenchée par un événement, comme l’approbation d’une demande d’exportation, et lorsque le système demandeur gère déjà les identités, les autorisations et l’audit. Avant de concevoir votre intégration, demandez la documentation de l’API au fournisseur ; pour un déploiement Enterprise adapté à vos contraintes, vous pouvez également contacter l’équipe. Les noms des points de terminaison, la méthode d’authentification, les limites de charge utile ainsi que le caractère synchrone ou asynchrone du traitement influencent tous le client que vous développerez.

Personne travaillant sur un ordinateur portable dans un environnement industriel, examinant des diagrammes, entourée de machines et d'équipement.

Le pipeline en sept étapes

Étape

Fonction

Protection contre

 

1. Ingestion

Accepter le fichier, enregistrer sa somme de contrôle et sa source

Les doublons invisibles et les fichiers inexpliqués

2. Validation

Vérifier le format, la résolution, la durée et le codec

Les tâches qui échouent après deux heures

3. Mise en file d’attente

Conserver l’état de la tâche avec son niveau de priorité

Le travail perdu après un redémarrage

4. Traitement

Exécuter la détection et le floutage

L’aspect auquel tout le monde pense déjà

5. Contrôle qualité

Échantillonner et vérifier avant diffusion

Les détections manquées qui parviennent à un destinataire

6. Exportation

Remettre le résultat au demandeur et journaliser la diffusion

Les divulgations non tracées

7. Purge

Supprimer l’original selon une planification définie

Les violations de la limitation de conservation prévue par l’article 5, paragraphe 1, point e), du RGPD

Les étapes 2, 5 et 7 sont celles que les équipes omettent le plus souvent avant de devoir les reconstruire ultérieurement. Les formats d’entrée pris en charge sont JPG et PNG pour les images, ainsi que MP4 et MOV pour les vidéos ; la validation à l’étape 2 est donc une vérification peu coûteuse qui évite des échecs onéreux.

Cinq détails techniques qui déterminent la fiabilité

  1. Idempotence grâce au hachage de contenu. Basez les tâches sur la somme de contrôle du fichier source, et non sur son nom. Les exports de caméras produisent très souvent des conflits de noms.
  2. Segmentez les fichiers longs. Découpez les enregistrements de plusieurs heures en segments, traitez-les, puis réassemblez-les. En cas d’échec, vous ne perdez qu’un segment plutôt que l’ensemble de la tâche.
  3. Limitez la concurrence en fonction des licences. La licence flottante de l’offre Enterprise détermine le nombre de workers pouvant s’exécuter simultanément. Configurez le pool de workers selon ce nombre, et non selon le nombre de cœurs de votre infrastructure.
  4. Séparez l’espace de travail temporaire de la livraison. Les sorties partielles ne doivent jamais pouvoir être écrites dans le répertoire à partir duquel le demandeur récupère les fichiers. C’est ainsi que des contenus non anonymisés ou partiellement anonymisés peuvent être divulgués.
  5. Journalisez les tâches, pas les personnes. Enregistrez le hachage du fichier, les paramètres, les horodatages et l’identité de l’opérateur. Ne créez pas de journal des éléments détectés. Gallio PRO ne stocke lui-même aucun journal de détection ni aucune donnée personnelle ; votre pipeline ne doit pas réintroduire ce risque.
Image en noir et blanc de racks de serveurs avec un superposition de code, donnant une ambiance digitale et technologique.

Le contrôle qualité n’est pas facultatif

L’automatisation change la personne qui effectue les vérifications, mais ne supprime pas la nécessité de les effectuer. Mettez en place un contrôle explicite reposant sur trois règles : un taux d’échantillonnage fixe pour les lots de routine, une vérification complète pour tout contenu destiné à un tribunal, à une autorité de régulation ou au public, ainsi qu’un chemin défini vers l’éditeur manuel pour les exceptions.

Ce circuit de gestion des exceptions est essentiel, car la détection automatique couvre uniquement les visages et les plaques d’immatriculation. Les badges nominatifs, les écrans, les documents, les tatouages et les logos doivent être masqués dans l’éditeur manuel intégré. Tout fichier contenant ces éléments quitte donc volontairement le parcours automatisé. Si possible, signalez ces catégories dès l’ingestion en utilisant l’emplacement de la caméra ou le type de demande, afin qu’elles soient orientées correctement au lieu d’être découvertes au moment du contrôle.

Pour des recommandations adaptées aux volumes importants, consultez notre article sur l’anonymisation à grande échelle de vastes ensembles de photos et de vidéos. Si les séquences proviennent d’un système de gestion vidéo, les points à prendre en compte pour l’intégration sont détaillés dans notre guide sur l’anonymisation vidéo dans les systèmes VMS.

Concevoir le pipeline en six étapes

  1. Définissez la machine à états avant d’écrire le code. Listez chaque état de tâche et chaque transition, y compris les échecs et la révision manuelle. La plupart des défauts de pipeline proviennent d’états manquants, et non de mauvais algorithmes.
  2. Demandez la documentation de l’API et les spécifications du conteneur. Vérifiez l’authentification, les limites de charge utile, le traitement synchrone ou par tâches, ainsi que les codes de sortie avant de vous engager dans une conception.
  3. Évaluez les performances d’un worker sur vos propres séquences. Vous pouvez télécharger la version de démonstration gratuite de Gallio PRO, illimitée et filigranée jusqu’à 720p, afin d’établir le débit d’un seul worker, puis de le multiplier par votre niveau de concurrence sous licence.
  4. Définissez le contrôle qualité et son taux d’échantillonnage. Documentez qui vérifie, à quelle fréquence et ce qui se produit lorsqu’une omission est détectée. Incluez le parcours vers l’éditeur manuel pour les badges, les écrans et les documents.
  5. Instrumentez le pipeline sans données personnelles. Suivez le débit, le taux d’échec, la profondeur de la file d’attente et le délai de livraison à l’aide d’identifiants de fichiers, jamais du contenu des détections.
  6. Automatisez la purge. Planifiez la suppression des originaux et documentez ce calendrier. Un pipeline automatisé qui ne supprime jamais rien devient un passif croissant, et non un gain d’efficacité.
Image en noir et blanc d'un écran d'ordinateur affichant les données de performance du système et des statistiques numériques, avec un fond sombre.

Cas d’usage adaptés et limites

Cette architecture convient aux contenus enregistrés traités par lots : exports de caméras, lots de preuves, arriérés d’archives et jeux de données d’entraînement. Pour les travaux sur des jeux de données contenant beaucoup d’images, les mêmes principes s’appliquent avec l’anonymisation d’images avec Gallio PRO, généralement avec un nombre de fichiers bien plus élevé et un temps de traitement plus court par fichier.

Elle ne convient pas aux flux en direct. Gallio PRO traite des fichiers enregistrés et n’effectue pas de traitement de flux vidéo en temps réel ; une architecture conçue pour un flux continu nécessite donc une autre catégorie d’outil. Il est préférable de l’indiquer dès la revue de conception plutôt que de le découvrir lors de l’intégration.

Comme tout s’exécute sur votre propre infrastructure, les séquences ne quittent jamais votre environnement et votre architecture n’introduit aucune dépendance à un traitement externe, ce qui réduit également le périmètre de conformité. Les options de déploiement sont présentées sur la page consacrée à l’anonymisation vidéo avec Gallio PRO.

Gros plan sur une rangée de baies de serveurs noires dans un centre de données, avec un éclairage tamisé mettant en valeur les composants métalliques.

FAQ

Gallio PRO propose-t-il une API pour automatiser l’anonymisation ?

Oui. Une API REST, un conteneur Docker et une interface en ligne de commande Linux sont disponibles avec l’offre Enterprise. Demandez la documentation de l’API au fournisseur avant de concevoir votre client.

L’anonymisation peut-elle s’exécuter dans un conteneur sur nos propres serveurs ?

Oui. Le conteneur Docker est le choix habituel pour un nœud de traitement interne partagé, le traitement s’effectuant intégralement sur votre propre matériel.

Comment traiter des fichiers vidéo de plusieurs heures ?

Découpez-les en segments, traitez chaque segment indépendamment, puis réassemblez-les. En cas d’échec, vous ne perdez qu’un segment plutôt que toute la tâche, et la progression est conservée après les redémarrages.

Une vérification humaine reste-t-elle nécessaire si le pipeline est automatisé ?

Oui. Mettez en place un contrôle qualité explicite avec un taux d’échantillonnage pour les lots de routine, une vérification complète pour les contenus destinés aux tribunaux, aux autorités de régulation ou au public, ainsi qu’un parcours vers l’éditeur manuel pour les éléments qui ne sont pas détectés automatiquement.

Peut-on appliquer l’anonymisation à un flux de caméra en direct ?

Pas avec Gallio PRO. La solution traite des fichiers enregistrés plutôt que des flux en direct ; les pipelines doivent donc être conçus autour d’un traitement par lots ou déclenché par un événement sur des contenus stockés.

Mateusz Zimoch

PDG et co-fondateur de Gallio PRO, est un ingénieur possédant une vaste expertise en informatique, science des données, robotique et intelligence artificielle. Mateusz est diplômé avec une double spécialisation de l'Université de technologie de Wrocław et a lancé deux startups centrées sur le développement de solutions de vision par ordinateur basées sur l'IA et la construction de véhicules télécommandés (ROV).