Définition de l’Intersection over Union (IoU)
L’Intersection over Union (IoU) est une métrique qui mesure dans quelle mesure une zone de détection prédite correspond à la zone annotée d’un objet réel. Elle est couramment utilisée pour évaluer les systèmes de détection d’objets, notamment ceux qui détectent les visages et les plaques d’immatriculation dans des images ou des images vidéo avant leur floutage.
L’IoU compare deux régions : une boîte englobante prédite, générée par un modèle de détection, et une boîte englobante de référence créée par un annotateur. Le résultat est compris entre 0 et 1. Une valeur d’IoU égale à 1 signifie que les deux régions sont identiques. Une valeur d’IoU égale à 0 signifie qu’elles ne se chevauchent pas.
La métrique est calculée comme suit :
IoU = Surface de chevauchement / Surface d’union
La surface d’union comprend tous les pixels couverts par la boîte englobante prédite ou par la boîte englobante de référence. La zone de chevauchement comprend uniquement les pixels couverts par les deux boîtes.
Valeur d’IoU | Interprétation
|
|---|---|
0,00 | Aucun chevauchement entre la boîte prédite et la boîte de référence. |
0,50 | Chevauchement partiel. Il s’agit d’un seuil minimal couramment utilisé pour considérer une détection comme correcte lors d’une évaluation de référence. |
0,75 | Forte correspondance entre la boîte prédite et l’objet annoté. |
1,00 | Correspondance parfaite entre les boîtes prédite et annotée. |
L’IoU est une métrique d’évaluation technique. Elle ne permet pas, à elle seule, de déterminer si le traitement d’images ou de vidéos est licite, si des images sont anonymisées ou si un effet de floutage protège suffisamment l’identité d’une personne. Elle aide à évaluer si l’étape de détection identifie la bonne région de l’image en vue de son anonymisation ultérieure.
Application de l’Intersection over Union au floutage des visages et des plaques d’immatriculation
L’anonymisation automatisée d’images exige généralement plusieurs étapes distinctes. Un modèle effectue d’abord une détection de visages ou une détection de plaques d’immatriculation. Il génère ensuite une boîte englobante et un score de confiance. Le système peut appliquer un floutage, une pixellisation, un masquage ou une autre transformation visuelle à la zone détectée.
L’IoU est particulièrement utile lors des tests de modèles, car une boîte de détection trop petite peut laisser visibles des parties identifiantes d’un visage ou d’une plaque d’immatriculation. Une boîte trop grande peut masquer inutilement du contenu de l’image. Dans le cadre d’un traitement axé sur la protection de la vie privée, les évaluateurs doivent examiner à la fois le score IoU et la couverture visuelle produite par l’effet final de floutage ou de pixellisation.
- Boîte de détection trop petite : la boîte englobante peut ne pas couvrir l’ensemble du visage, la ligne des cheveux ou les contours de la plaque d’immatriculation. Le floutage qui en résulte peut laisser visibles des détails permettant l’identification.
- Boîte de détection trop grande : la boîte peut couvrir des personnes à proximité, des panneaux routiers, des détails de véhicules ou d’autres éléments de contexte qu’il n’est pas nécessaire de masquer.
- Boîte correcte mais floutage insuffisant : une détection peut présenter un IoU élevé alors que le floutage appliqué reste trop faible pour empêcher l’identification.
- Objet non détecté : l’IoU ne peut pas être calculé pour un objet que le système ne détecte pas. Le rappel est nécessaire pour mesurer les visages ou les plaques d’immatriculation non détectés.
Pour cette raison, l’IoU ne doit pas être utilisé comme seul critère d’acceptation d’un processus d’anonymisation d’images ou de vidéos. Il doit être évalué avec le rappel, la précision, le taux de faux négatifs, les seuils de confiance et des contrôles qualité manuels.
Seuils d’IoU dans l’évaluation de la détection
Un seuil d’IoU détermine à quel moment une boîte englobante prédite est considérée comme correspondant à un objet de référence. Si l’IoU mesuré atteint ou dépasse le seuil sélectionné, la prédiction peut être classée comme un vrai positif. S’il est inférieur au seuil, elle est généralement considérée comme un faux positif, même si elle chevauche partiellement l’objet.
Le seuil approprié dépend du cas d’usage, de la taille de l’objet, des règles d’annotation et du risque pour la vie privée. Les petits visages dans des images vidéo éloignées et les plaques d’immatriculation inclinées peuvent être difficiles à annoter et à détecter avec précision. Un seuil fixe unique peut donc masquer des faiblesses importantes.
Approche d’évaluation | Méthode de seuil d’IoU | Signification pratique
|
|---|---|---|
PASCAL Visual Object Classes (VOC) | IoU de 0,50 | Une détection est généralement acceptée lorsque son chevauchement avec l’objet de référence atteint au moins 50 %. |
Common Objects in Context (COCO) | Moyenne des seuils d’IoU allant de 0,50 à 0,95, par incréments de 0,05 | La métrique mesure les performances selon des exigences de localisation à la fois modérées et strictes. |
Tests internes axés sur la protection de la vie privée | Défini par l’organisation | Le seuil doit être documenté avec les paramètres d’extension du floutage, les règles de contrôle et la tolérance au risque. |
Le défi PASCAL VOC utilisait un seuil d’IoU de 0,5 pour l’évaluation de la détection d’objets. L’évaluation COCO utilise la précision moyenne sur dix seuils, de 0,50 à 0,95. L’évaluation de type COCO est plus stricte, car une détection validée à 0,50 peut échouer à des seuils plus élevés.
IoU, précision et rappel dans les tests de qualité de l’anonymisation
L’IoU mesure la qualité de localisation des détections correspondantes. Elle ne mesure pas toutes les erreurs de détection. Une évaluation robuste du floutage des visages ou du floutage des plaques d’immatriculation doit associer l’IoU à des métriques indiquant si les objets ont été trouvés et si des objets incorrects ont été sélectionnés.
- Précision : la proportion de boîtes détectées qui correspondent réellement à des visages ou à des plaques d’immatriculation. Une faible précision peut entraîner un floutage inutile.
- Rappel : la proportion de visages ou de plaques d’immatriculation réellement présents qui ont été détectés. Un faible rappel crée un risque que des objets identifiables restent visibles.
- Faux négatifs : visages ou plaques d’immatriculation présents dans les images vidéo, mais non détectés par le modèle.
- Faux positifs : zones détectées à tort comme des visages ou des plaques d’immatriculation.
- Précision moyenne (AP) : mesure synthétique associant précision et rappel à un seuil d’IoU donné ou sur plusieurs seuils.
Pour les images vidéo, l’évaluation doit également prendre en compte le comportement d’une image à l’autre. Un détecteur peut atteindre un IoU acceptable sur des images individuelles, mais ne pas détecter ponctuellement un visage lors d’un mouvement, d’une occultation, d’un flou de mouvement, d’un éclairage insuffisant ou d’un changement d’angle de caméra. Les tests doivent donc inclure des séquences représentatives, et pas seulement des images fixes isolées.
Limites de l’Intersection over Union pour la protection de la vie privée
L’IoU est utile pour évaluer les boîtes englobantes, mais elle présente des limites dans le traitement d’images sensible à la vie privée. Elle traite tous les pixels contenus dans une boîte de la même manière. Elle ne permet pas de déterminer si la boîte contient des éléments identifiants, si une personne reste reconnaissable grâce au contexte ou si une image transformée répond aux exigences de confidentialité d’une organisation.
L’IoU peut également être sensible à la taille de l’objet. Un léger décalage d’une boîte englobante peut réduire considérablement l’IoU pour un visage éloigné ou une petite plaque d’immatriculation. À l’inverse, un IoU relativement élevé peut rester insuffisant si la boîte prédite exclut une partie essentielle permettant l’identification de l’objet.
La qualité des annotations constitue une autre limite. Les boîtes de référence doivent suivre des consignes d’annotation documentées. Les évaluateurs doivent définir si les boîtes incluent les cheveux, les oreilles, les couvre-visages, les reflets, les plaques partiellement visibles et les objets affectés par le flou de mouvement. Des politiques d’annotation différentes peuvent produire des résultats IoU différents pour un même modèle de détection.
Utiliser l’IoU pour évaluer des outils d’anonymisation d’images et de vidéos
Les organisations qui évaluent un outil d’anonymisation des visages et des plaques d’immatriculation doivent demander des résultats de test précisant le jeu de données, la méthode d’annotation, les catégories d’objets, les seuils d’IoU, les seuils de confiance et les définitions d’erreurs. Sans ce contexte, les résultats sont difficiles à comparer.
Un processus d’évaluation pratique peut comprendre les étapes suivantes :
- Créer ou obtenir un jeu de données de test représentatif composé d’images ou d’images vidéo contenant des visages et des plaques d’immatriculation annotés manuellement.
- Exécuter le processus de détection avec des paramètres de configuration documentés.
- Associer les boîtes prédites aux boîtes de référence à l’aide d’un seuil d’IoU défini.
- Calculer la précision, le rappel, les faux positifs, les faux négatifs et la précision moyenne.
- Examiner visuellement des échantillons après floutage, en particulier les détections proches du seuil d’IoU retenu.
- Tester des conditions difficiles telles qu’une faible résolution, les ombres, l’occultation partielle, les visages de profil, les véhicules en mouvement et les scènes très fréquentées.
Gallio PRO utilise la détection de visages et la détection de plaques d’immatriculation afin de prendre en charge les processus d’anonymisation d’images et de vidéos. Son traitement automatique couvre les visages et les plaques d’immatriculation. Les autres éléments, tels que les logos, les tatouages, les badges nominatifs, les documents et le contenu affiché sur des écrans, exigent une vérification manuelle et une modification dans l’éditeur manuel lorsqu’ils doivent être masqués.
Normes et références
L’IoU est largement utilisée dans la recherche en vision par ordinateur et dans les évaluations de référence, mais elle n’est définie par aucune norme technique universelle unique. Les publications principales suivantes sont des sources fréquemment citées concernant son utilisation dans l’évaluation de la détection d’objets.
- PASCAL Visual Object Classes Challenge, International Journal of Computer Vision, 2010 - définit le critère de chevauchement utilisé dans le défi de détection PASCAL VOC.
- Évaluation de la détection Common Objects in Context (COCO) - documente l’évaluation de la précision moyenne sur des seuils d’IoU allant de 0,50 à 0,95.
- Microsoft COCO : Common Objects in Context, 2014 - présente le jeu de données COCO et son cadre d’évaluation de la détection d’objets.
- National Institute of Standards and Technology (NIST), Face Recognition Vendor Test (FRVT) - fournit un exemple distinct de test structuré des performances biométriques, bien que les métriques FRVT ne remplacent pas l’évaluation IoU des boîtes englobantes.