Czym jest anonimizacja zbioru treningowego?

Anonimizacja zbioru treningowego - definicja

Anonimizacja zbioru treningowego to proces trwałego usunięcia lub przekształcenia identyfikatorów osób oraz oznaczeń pojazdów w zdjęciach oraz nagraniach wideo używanych do uczenia, walidacji albo testowania modeli uczenia maszynowego. W praktyce oznacza to najczęściej wykrywanie twarzy, zamazywanie twarzy, wykrywanie tablic rejestracyjnych oraz zamazywanie tablic rejestracyjnych przed przekazaniem materiału do zespołu data science, dostawcy narzędzi anotacyjnych lub środowiska treningowego.

W kontekście RODO anonimizacja jest skuteczna tylko wtedy, gdy osoba fizyczna nie jest już możliwa do zidentyfikowania przy użyciu środków, które można rozsądnie zastosować. Wynika to z motywu 26 RODO, czyli rozporządzenia Parlamentu Europejskiego i Rady (UE) 2016/679 z 27 kwietnia 2016 r. Jeżeli twarz, tablica rejestracyjna lub inny element kadru nadal pozwala na identyfikację osoby, zbiór pozostaje zbiorem danych osobowych.

Anonimizacja zbioru treningowego różni się od zwykłego przygotowania danych. Jej celem nie jest poprawa jakości obrazu, lecz ograniczenie zakresu danych do minimum potrzebnego dla danego zadania modelu. Jeżeli model ma uczyć się detekcji obiektów drogowych, twarze przechodniów zwykle nie są potrzebne. Jeżeli model ma analizować zajętość parkingu, pełna czytelność tablic rejestracyjnych najczęściej nie jest konieczna.

Rola anonimizacji zbioru treningowego w uczeniu maszynowym

Anonimizacja zbioru treningowego wspiera zasadę minimalizacji danych z art. 5 ust. 1 lit. c RODO. Dane powinny być adekwatne, stosowne i ograniczone do tego, co niezbędne do celu przetwarzania. W projektach foto i wideo ta zasada ma bezpośrednie znaczenie, ponieważ pojedyncza klatka może zawierać wiele osób postronnych, pojazdów i elementów kontekstowych.

Typowy proces obejmuje kilka etapów technicznych. Najpierw materiał jest importowany do środowiska roboczego. Następnie wykonywana jest automatyczna detekcja twarzy i tablic rejestracyjnych. Potem system nakłada maski anonimizujące, na przykład rozmycie, pikselizację albo jednolite zakrycie. Na końcu operator wykonuje kontrolę jakości oraz poprawki manualne tam, gdzie detekcja była niepełna.

Etap

Cel

Ryzyko dla zbioru treningowego

 

Detekcja twarzy

Oznaczenie obszarów zawierających twarze osób

Pominięcie twarzy w profilu, odbiciu lub tłumie

Detekcja tablic rejestracyjnych

Oznaczenie tablic pojazdów widocznych w kadrze

Pominięcie tablic pod kątem, zabrudzonych lub częściowo zasłoniętych

Zamazywanie

Trwałe ograniczenie identyfikowalności

Zbyt słaba maska, która pozwala odtworzyć treść

Kontrola jakości

Weryfikacja kompletności anonimizacji

Brak próbkowania lub brak reguł akceptacji błędów

Techniki anonimizacji zdjęć i nagrań wideo

W zbiorach treningowych stosuje się techniki, które ingerują w piksele obrazu. Samo usunięcie metadanych pliku, takich jak EXIF, nie anonimizuje twarzy ani tablic widocznych w kadrze. Również pseudonimizacja nazw plików nie usuwa identyfikowalności osób utrwalonych na nagraniu.

Najczęściej stosowane techniki to:

  • rozmycie gaussowskie - obniża szczegółowość obszaru twarzy lub tablicy, ale musi być dobrane do rozdzielczości materiału;
  • pikselizacja - zastępuje fragment obrazu blokami pikseli, co ogranicza możliwość odczytu szczegółów;
  • maskowanie pełne - zakrywa obszar jednolitym kolorem, co zwykle daje większą odporność na próby rekonstrukcji;
  • redakcja manualna - pozwala zamazać elementy niewykrywane automatycznie, na przykład logo, tatuaż, identyfikator imienny, dokument lub obraz na monitorze.

Gallio PRO automatycznie wykrywa i zamazuje twarze oraz tablice rejestracyjne. Nie wykonuje automatycznej detekcji logotypów, tatuaży, tabliczek z imionami, dokumentów ani ekranów monitorów. Takie elementy mogą być zamazane ręcznie w edytorze. Gallio PRO nie służy do anonimizacji strumienia wideo w czasie rzeczywistym.

Kluczowe parametry i metryki anonimizacji zbioru treningowego

Jakość anonimizacji należy mierzyć przed użyciem zbioru w trenowaniu, walidacji lub testowaniu modelu. Sam fakt uruchomienia algorytmu detekcji nie przesądza o zgodności z zasadą minimalizacji. Istotne są zarówno metryki detekcji, jak i kontrola skuteczności maskowania.

Metryka

Znaczenie praktyczne

Uwagi

 

Recall

Odsetek rzeczywistych twarzy lub tablic wykrytych przez model

W anonimizacji zwykle ważniejszy niż sama precyzja, bo pominięcie obiektu oznacza ryzyko ujawnienia

Precision

Odsetek detekcji, które faktycznie są twarzami lub tablicami

Niska precyzja może pogorszyć użyteczność datasetu przez nadmierne maskowanie

IoU

Stopień pokrycia maski z obiektem referencyjnym

Stosowana w ocenie detekcji obiektów, między innymi w benchmarkach typu COCO

Stopa błędów po kontroli manualnej

Odsetek lub liczba niezamazanych identyfikatorów po przeglądzie jakościowym

Powinna być dokumentowana dla próbki lub całości zbioru

Dla nagrań wideo ważna jest też spójność czasowa maski. Twarz lub tablica może zniknąć w jednej klatce i pojawić się w kolejnej. Dlatego kontrola powinna obejmować nie tylko pojedyncze klatki, ale również sekwencje z ruchem, zmianą oświetlenia i częściowym zasłonięciem obiektu.

Znaczenie dla zgodności z RODO i EU AI Act

Anonimizacja zbioru treningowego może ograniczyć zakres stosowania RODO do dalszego wykorzystania materiału, ale tylko wtedy, gdy jest skuteczna. Jeżeli materiał po przetworzeniu nadal pozwala zidentyfikować osobę, trzeba stosować pełne wymagania RODO, w tym podstawę prawną z art. 6, obowiązki informacyjne z art. 13 lub 14, zabezpieczenia z art. 32 oraz zasadę privacy by design z art. 25.

W projektach AI znaczenie ma również rozporządzenie Parlamentu Europejskiego i Rady (UE) 2024/1689, czyli EU AI Act. Art. 10 tego aktu przewiduje wymogi dotyczące zarządzania danymi dla systemów AI wysokiego ryzyka, w tym trafność, wystarczającą reprezentatywność, możliwie największą kompletność i wolność od błędów zbiorów danych. Anonimizacja nie może więc zniszczyć cech potrzebnych do trenowania modelu, ale powinna usuwać dane zbędne dla celu.

Przykład: dataset do analizy natężenia ruchu może zachować trajektorie pojazdów, typ pojazdu i czas przejazdu, ale nie musi zachowywać czytelnych tablic rejestracyjnych ani twarzy pieszych. Dataset do wykrywania kasków ochronnych może wymagać widoczności głowy, ale niekoniecznie identyfikowalnej twarzy pracownika.

Odniesienia normatywne i standardy

Podstawowe wymagania wynikają z prawa ochrony danych i dokumentów technicznych dotyczących anonimizacji oraz jakości danych. Warto odróżnić akty prawne od wytycznych, ponieważ mają inną moc wiążącą.

  • RODO 2016/679 - art. 5 ust. 1 lit. c, art. 25, art. 32 oraz motyw 26 dotyczący danych anonimowych i identyfikowalności.
  • Opinia Grupy Roboczej Art. 29 nr 05/2014 z 10 kwietnia 2014 r. - omawia techniki anonimizacji i ryzyka reidentyfikacji.
  • Wytyczne EROD 3/2019 w sprawie przetwarzania danych osobowych przez urządzenia wideo, wersja 2.0 z 29 stycznia 2020 r. - dotyczą ryzyk związanych z obrazem wideo.
  • ISO/IEC 20889:2018 - opisuje techniki deidentyfikacji danych i terminologię przydatną przy ocenie anonimizacji.
  • ISO/IEC 5259-1:2024 - dotyczy jakości danych dla analityki i uczenia maszynowego, w tym pojęć związanych z jakością datasetów.
  • EU AI Act 2024/1689 - art. 10 wskazuje wymagania dla danych treningowych, walidacyjnych i testowych w systemach AI wysokiego ryzyka wykorzystujących zbiory danych do trenowania modeli.