Définition de la cohérence temporelle
La cohérence temporelle désigne la capacité d’un processus d’anonymisation d’images ou de vidéos à appliquer un masque de confidentialité stable au même objet sur des images vidéo consécutives. Lors du floutage des visages et du floutage des plaques d’immatriculation, l’objet est généralement représenté par une boîte englobante suivie, un polygone ou un masque de segmentation au niveau des pixels. La position, la taille, la forme et la couverture du floutage doivent évoluer en suivant le mouvement de l’objet.
Un résultat temporellement cohérent empêche qu’un visage ou une plaque d’immatriculation soit flouté sur une image, partiellement visible sur l’image suivante, puis de nouveau flouté plus tard. Cette variation indésirable est appelée scintillement du masque ou scintillement temporel. Elle peut exposer brièvement des informations visuelles permettant d’identifier une personne, même lorsque le résultat de l’anonymisation semble satisfaisant lors de l’examen séparé de chaque image.
La cohérence temporelle est une propriété de qualité technique. Elle ne correspond pas à la précision de la détection de visages. Un système peut détecter avec précision des visages sur de nombreuses images individuelles tout en produisant un masquage incohérent s’il ne parvient pas à relier, au fil du temps, les détections appartenant au même objet en mouvement.
Pourquoi la cohérence temporelle est essentielle pour l’anonymisation vidéo
Une vidéo est une succession d’images liées entre elles. Les objets se déplacent, changent d’orientation, sont partiellement occultés, sortent du champ et réapparaissent. Les artefacts de compression, le flou de mouvement, la faible luminosité, les reflets et les mouvements de caméra peuvent également réduire la qualité de la détection. Une approche image par image traite chaque image indépendamment et peut donc entraîner une couverture de floutage instable.
Pour la protection de la vie privée, un court intervalle sans masquage peut être significatif. Un spectateur peut mettre une vidéo en pause, examiner des images individuelles ou utiliser un logiciel pour les extraire. La cohérence temporelle contribue donc à réduire le risque qu’un visage ou une plaque d’immatriculation devienne visible lors d’échecs de détection, de changements de trajectoire ou de variations brusques de la position d’un objet.
En pratique, la cohérence temporelle impose que le processus d’anonymisation traite les situations suivantes :
- La détection des visages et des plaques d’immatriculation dans chaque image pertinente.
- L’association d’un objet détecté au même objet dans les images adjacentes.
- La prédiction de la position d’un objet lorsqu’une détection est temporairement absente.
- L’extension stable du masque afin que la couverture du floutage inclue les contours de l’objet.
- La gestion contrôlée des occultations, des changements de scène et de la réapparition d’objets.
- L’examen de la vidéo produite, sans se fier uniquement aux résultats de détection.
Détection, suivi et propagation du masque
La cohérence temporelle résulte généralement de la combinaison de la détection d’objets et du suivi de plusieurs objets. La détection repère les visages ou les plaques d’immatriculation susceptibles d’apparaître dans une image. Le suivi associe ensuite ces détections d’une image à l’autre et leur attribue un identifiant local de trajectoire. Cet identifiant sert uniquement à maintenir la continuité au sein de la séquence vidéo. Il ne nécessite ni détection de visages à des fins d’identification ni identification d’une personne.
Un système de suivi peut estimer la position suivante d’un objet à partir de ses mouvements antérieurs. Une méthode courante utilise un estimateur d’état tel qu’un filtre de Kalman. La position prédite peut préserver la couverture de floutage lorsqu’un détecteur manque un objet pendant un nombre limité d’images. Le système doit néanmoins définir à quel moment une trajectoire prédite expire. Maintenir une prédiction trop longtemps peut flouter une zone après le déplacement de l’objet.
Composant de traitement | Fonction dans l’anonymisation | Risque pour la cohérence temporelle
|
|---|---|---|
Détection de visages | Repère les visages dans des images individuelles. | Les détections manquées peuvent créer des images sans floutage. |
Détection des plaques d’immatriculation | Repère les plaques d’immatriculation visibles des véhicules. | Le flou de mouvement et les angles obliques peuvent interrompre la détection. |
Suivi d’objets | Relie les détections au fil du temps. | Des associations incorrectes peuvent déplacer un masque vers un autre objet. |
Propagation du masque | Utilise les informations de suivi pour maintenir le masquage entre les détections. | Une propagation excessive peut provoquer un floutage inutile. |
Encodage de sortie | Enregistre les images traitées sous forme de vidéo. | La compression peut affecter la limite visible d’un masque. |
Paramètres et indicateurs clés de la cohérence temporelle
L’évaluation doit mesurer à la fois la précision spatiale dans une image et la continuité entre les images. L’intersection sur l’union, ou IoU, est couramment utilisée pour comparer une boîte englobante ou un masque prédit avec la vérité terrain. Pour deux régions, A et B, l’IoU se calcule ainsi :
IoU = aire(A ∩ B) / aire(A ∪ B)
Pour l’anonymisation vidéo, l’IoU seule ne suffit pas, car elle n’indique pas si un masque était présent pendant toute la durée de visibilité d’un objet. Une évaluation de la qualité doit inclure les mesures suivantes.
- Rappel au niveau de l’image : la proportion de visages ou de plaques d’immatriculation de la vérité terrain qui reçoivent un masque de confidentialité dans une image.
- Rappel au niveau de la trajectoire : la proportion des trajectoires d’objets qui restent masquées pendant toute leur durée de visibilité.
- Taux de continuité du masque : la proportion d’images consécutives durant lesquelles une trajectoire d’objet active reste couverte.
- Fragmentation de trajectoire : le nombre de segments de trajectoire distincts attribués à un même objet réel.
- Changements d’identité : les erreurs de suivi dans lesquelles une trajectoire est incorrectement attribuée d’un objet à un autre.
- Taux de masquage erroné : la fréquence à laquelle un floutage est appliqué alors qu’aucun visage ni aucune plaque d’immatriculation n’est présent.
Le Multiple Object Tracking Benchmark a introduit des concepts d’évaluation standardisés pour le suivi, notamment les faux positifs, les faux négatifs, les changements d’identité et la fragmentation des trajectoires. Ces indicateurs sont utiles, car les défaillances du masquage de confidentialité peuvent provenir des performances de suivi, et pas uniquement des performances de détection d’objets.
Causes et effets du scintillement du masque
Le scintillement du masque se produit lorsque la couverture de floutage change brusquement d’une image à l’autre. Il peut apparaître sous la forme d’un visage flouté de manière intermittente, d’une plaque d’immatriculation dont les bords sont visibles sur certaines images, ou d’un masque qui saute d’une personne à une autre située à proximité. L’effet est particulièrement visible lorsque la caméra se déplace rapidement ou lorsque plusieurs visages se chevauchent.
Parmi les causes fréquentes figurent les détections à faible niveau de confiance, un détecteur qui ne s’exécute que sur certaines images, des coordonnées de boîte englobante instables, l’association incorrecte d’objets proches et les transitions brusques entre scènes. La compression vidéo peut également rendre la limite d’un masque instable visuellement, en particulier lorsque la zone de floutage est petite ou épouse étroitement les contours de l’objet.
Le lissage temporel peut réduire le scintillement visuel, mais le lissage seul ne constitue pas une mesure de protection de la vie privée. Si un masque est trop petit, le lissage peut maintenir une zone insuffisamment couverte sur plusieurs images. S’il est trop grand, il peut masquer des informations qu’il n’est pas nécessaire d’anonymiser. Un traitement efficace équilibre continuité, couverture et masquage erroné.
Application pratique dans Gallio PRO
Lors de l’anonymisation d’enregistrements vidéo, la cohérence temporelle doit être vérifiée dans le cadre de l’assurance qualité. L’examen doit porter sur l’entrée et la sortie des objets, les mouvements rapides, les occultations partielles, les panoramiques, les zooms et les changements de scène. Ces situations constituent des points fréquents d’interruption du suivi d’un visage ou d’une plaque d’immatriculation.
Gallio PRO détecte automatiquement et floute les visages et les plaques d’immatriculation dans les fichiers image et vidéo pris en charge. Il n’effectue pas d’anonymisation en temps réel ni d’anonymisation de flux vidéo en direct. Lorsque le traitement automatique ne couvre pas correctement un visage, une plaque d’immatriculation ou un autre élément visuel, l’éditeur intégré permet d’appliquer un masquage manuel. Les logos d’entreprise, les tatouages, les badges nominatifs, les documents et le contenu affiché sur les moniteurs ne sont pas détectés automatiquement, mais peuvent être floutés manuellement.
Normes et références
La cohérence temporelle n’est pas définie par une norme dédiée à l’anonymisation. Elle est évaluée au moyen de méthodes issues du codage vidéo, de la détection d’objets et de la recherche sur le suivi de plusieurs objets. Les sources suivantes apportent des bases techniques pertinentes.
- ISO/IEC 23008-2:2020, Technologies de l’information - Codage à haute efficacité et fourniture de médias dans des environnements hétérogènes - Partie 2 : Codage vidéo à haute efficacité, Organisation internationale de normalisation (ISO) et Commission électrotechnique internationale (IEC).
- MOTChallenge, un référentiel pour le suivi de plusieurs objets qui documente les mesures d’évaluation et les jeux de données de suivi.
- Milan et al. (2016), MOT16: A Benchmark for Multi-Object Tracking, European Conference on Computer Vision Workshops.
- Bewley et al. (2016), Simple Online and Realtime Tracking, qui décrit une approche de suivi fondée sur la détection, utilisant l’estimation du mouvement et l’association.
- NIST Artificial Intelligence Risk Management Framework (AI RMF 1.0), National Institute of Standards and Technology, 2023.