W skrócie: Jeśli Twój zespół przetwarza nagrane materiały wideo lub zbiory obrazów i musi rozmywać twarze oraz tablice rejestracyjne, stworzenie własnego detektora jest tańsze tylko w pierwszym miesiącu. Koszty, które narastają z czasem, to utrzymanie, testy kompletności wykrywania, obsługa kodeków i dokumentacja na potrzeby audytów. Gallio PRO to lokalne oprogramowanie do anonimizacji dla liderów inżynierii, zespołów MLOps i właścicieli zbiorów danych, którzy wolą licencjonować to utrzymanie, zamiast tworzyć do tego osobny zespół.
Decyzja „budować czy kupić” jest w rzeczywistości decyzją o utrzymaniu
Niemal każdy zespół inżynieryjny oceniający oprogramowanie do anonimizacji najpierw prowadzi tę samą wewnętrzną dyskusję: mamy GPU, mamy Pythona, wstępnie wytrenowany detektor i filtr Gaussa można połączyć w jeden weekend. To prawda. Działający prototyp rzeczywiście da się stworzyć w weekend.
Prototyp nie jest jednak finalnym produktem. Finalnym produktem jest proces, który każdego dnia daje wynik dający się obronić - także dla materiałów, których nikt wcześniej nie przewidział - oraz zapis tego, co zostało zanonimizowane i dlaczego. To właśnie ten proces trzeba utrzymywać, wersjonować, testować i obsadzać zespołem przez lata. Porównując własne rozwiązanie z zakupem gotowego narzędzia, zespoły zwykle wyceniają weekend pracy, a pomijają dekadę utrzymania.
Ile naprawdę kosztuje własny pipeline anonimizacji
Poniżej przedstawiono pracę konieczną, aby przejść od prototypu do rozwiązania, które można dołączyć do umowy o udostępnianiu danych. Nakład pracy podano w dniach inżynierskich, aby można było podstawić własną stawkę z narzutami.
Element prac | Budowa początkowa | Utrzymanie roczne |
Wybór detektora twarzy i dostrojenie progów | 5-10 dni | 3-5 dni |
Wykrywanie tablic rejestracyjnych jako osobny model | 5-15 dni | 3-5 dni |
Wygładzanie czasowe i śledzenie obiektów między klatkami | 10-20 dni | 4-8 dni |
Obsługa kontenerów, kodeków i metadanych orientacji obrazu | 5-10 dni | 3-6 dni |
Interfejs ręcznej korekty niewykrytych obiektów | 15-30 dni | 5-10 dni |
Zbiór testowy kompletności wykrywania, środowisko QA i testy regresji | 10-15 dni | 10-15 dni |
Dokumentacja dla audytorów i na potrzeby przeglądów bezpieczeństwa | 5 dni | 3 dni |
Łącznie daje to około 55-105 dni pracy, aby dorównać gotowemu narzędziu, oraz 31-52 dni każdego kolejnego roku wyłącznie po to, by utrzymać obecny stan. Licencja Gallio PRO Standard kosztuje 89 EUR miesięcznie lub 1068 EUR rocznie po uwzględnieniu rabatu rocznego. Próg rentowności nie jest nawet bliski, a różnica to cały rząd wielkości.
Pięć miejsc, w których własne pipeline’y zawodzą na produkcji
- Kompletność wykrywania w trudnych ujęciach twarzy. Otwarte modele osiągają dobre wyniki dla twarzy widocznych z przodu, dobrze oświetlonych i znajdujących się w średniej odległości. Rzeczywiste nagrania to profile, rozmycie ruchu, podświetlenie od tyłu, nisko ustawione kamery i częściowe zasłonięcia. Zbiór demonstracyjny nie zawiera tych przypadków, na których model się wykłada.
- Tablice to osobny problem. Wykrywanie tablic rejestracyjnych jest innym zadaniem, z innymi trybami błędów, innymi proporcjami boków i układami charakterystycznymi dla poszczególnych krajów. Zespoły regularnie planują budżet na jeden model, a potem odkrywają, że potrzebują dwóch.
- Spójność między klatkami. Twarz wykryta w klatkach od 1 do 40, a pominięta w klatkach od 41 do 43, oznacza trzy klatki z ujawnioną tożsamością. W przypadku wideo dokładność pojedynczej klatki nie jest kluczową miarą.
- Kontenery i kodeki. Metadane orientacji obrazu, zmienna liczba klatek na sekundę, zachowanie ścieżki audio i integralność znaczników czasu nie są efektowne, ale to właśnie przez nie odbiorca może odrzucić wynikowy plik.
- Brak ścieżki korekty. Gdy automatyzacja coś pominie, ktoś musi to poprawić przed udostępnieniem materiału. Bez edytora rozwiązaniem awaryjnym jest program do montażu wideo i kilka godzin pracy.
Szersze omówienie samej detekcji znajdziesz w naszym omówieniu rozmywania twarzy dla ochrony prywatności danych w deep learningu.
Luka zgodności, która kosztuje najwięcej
Rozmywanie jest działaniem technicznym o konsekwencjach prawnych, a wymogi prawne są wyższe, niż zakłada większość planów budowy własnego rozwiązania.
- Motyw 26 RODO wyłącza dane rzeczywiście anonimowe z zakresu stosowania rozporządzenia. Dane jedynie spseudonimizowane nadal pozostają w jego zakresie wraz ze wszystkimi powiązanymi obowiązkami.
- Opinia Grupy Roboczej Art. 29 nr 05/2014 wskazuje trzy testy, które musi przejść każda technika anonimizacji: możliwość wyodrębnienia osoby, możliwość łączenia danych oraz wnioskowanie. Odwracalne lub częściowe rozmywanie nie spełnia tych warunków.
- Art. 25 ust. 1 RODO wymaga uwzględnienia ochrony danych w fazie projektowania i domyślnej ochrony danych, co oznacza, że anonimizacja musi być domyślnym stanem eksportu, a nie ręcznym krokiem, o którym można zapomnieć.
- Art. 32 ust. 1 RODO wymaga środków technicznych odpowiednich do ryzyka oraz oczekuje możliwości ich wykazania.
- Art. 35 ust. 3 lit. c RODO wymaga przeprowadzenia oceny skutków dla ochrony danych w przypadku systematycznego monitorowania na dużą skalę miejsc dostępnych publicznie.
- Akt w sprawie sztucznej inteligencji UE, rozporządzenie (UE) 2024/1689, art. 5 zakazuje nieukierunkowanego pozyskiwania z internetu lub nagrań CCTV wizerunków twarzy w celu tworzenia baz danych do rozpoznawania twarzy. Zmienia to już sam sposób, w jaki można tworzyć wizualne zbiory danych.
Wewnętrzny skrypt nie ma dokumentacji dostawcy, niezależnej walidacji ani dziennika zmian, który organ nadzorczy może przeanalizować. Wszystkie te elementy trzeba przygotować samodzielnie - albo nie będzie ich wtedy, gdy zostaną wymagane.
Jak przeprowadzić analizę „budować czy kupić” w sześciu krokach
- Określ na piśmie zakres anonimizacji. Tylko twarze, tylko tablice rejestracyjne czy oba typy obiektów. Osobno wskaż wszystko inne widoczne w kadrze, np. identyfikatory, ekrany lub dokumenty, ponieważ żadne narzędzie nie wykrywa ich automatycznie i będą wymagały ręcznej korekty.
- Przygotuj wymagający zbiór testowy. Wybierz 200-500 klatek z najtrudniejszych, a nie najlepszych warunków: noc, deszcz, szeroki kąt, tłum, poruszające się pojazdy.
- Mierz kompletność wykrywania, a nie dokładność. Znaczenie ma liczba pominiętych obiektów na tysiąc klatek. Jedna niewykryta twarz oznacza ujawnienie danych, niezależnie od tego, jak dobrze wygląda średni wynik.
- Wyceniaj utrzymanie, nie budowę. Weź przedstawioną powyżej kolumnę rocznego utrzymania, pomnóż ją przez własną stawkę inżynierską z narzutami i porównaj z ceną rocznej licencji.
- Przetestuj ten sam zbiór w wersji demonstracyjnej Gallio PRO. Demo jest bezpłatne i bez limitu użycia, zawiera znak wodny oraz ograniczenie do 720p - to wystarczy, aby zmierzyć kompletność wykrywania na własnych materiałach przed zakupem. Możesz pobrać wersję demo i sprawdzić rzeczywisty przepływ pracy.
- Podejmij decyzję na podstawie kosztu godziny przetworzonego materiału. W obu wariantach uwzględnij czas potrzebny na ręczne poprawki. Ta jedna liczba kończy większość sporów o własne rozwiązanie i zakup gotowego narzędzia.
Co Gallio PRO robi, a czego nie robi
Gallio PRO działa całkowicie na własnym komputerze lub serwerze. Przetwarzanie odbywa się lokalnie, więc nagrania nigdy nie opuszczają Twojej infrastruktury, a oprogramowanie nie zapisuje dzienników detekcji ani danych osobowych. Narzędzie jest dostępne jako aplikacja desktopowa dla systemów Windows 10 i nowszych, macOS 10.14 i nowszych oraz Linux z glibc 2.35 lub nowszym, a także jako kontener Docker i interfejs REST API do integracji z istniejącym pipeline’em. Akceleracja GPU zapewnia nawet dziesięciokrotnie szybsze przetwarzanie. Obsługiwane formaty to JPG i PNG dla obrazów oraz MP4 i MOV dla wideo.
Automatyczne wykrywanie obejmuje wyłącznie twarze i tablice rejestracyjne. Tatuaże, identyfikatory z nazwiskiem, logotypy firm, dokumenty i ekrany monitorów nie są wykrywane automatycznie - można je obsłużyć we wbudowanym edytorze ręcznym, który pozwala także selektywnie usunąć rozmycie przed eksportem. Gallio PRO przetwarza zapisane pliki i nie obsługuje transmisji na żywo. Jeśli potrzebujesz przetwarzać transmisję live, jest to niewłaściwa kategoria narzędzi i warto jasno określić to na wczesnym etapie.
Kiedy budowa własnego rozwiązania nadal ma sens
Trzy przypadki uzasadniają taką inwestycję. Po pierwsze, gdy anonimizacja jest Twoim produktem, a nie jednym z jego etapów. Po drugie, gdy głównymi obiektami do wykrywania są elementy, których żadne komercyjne narzędzie nie automatyzuje - wtedy i tak trzeba budować własny detektor. Po trzecie, gdy używane formaty wykraczają poza standardowe kontenery obrazów i wideo, np. surowe dane z czujników lub zastrzeżona telemetria.
W przypadku wdrożeń korporacyjnych, niestandardowych konfiguracji lokalnych lub szczególnych wymogów zgodności warto skontaktować się z zespołem, aby omówić konkretny scenariusz.
Jeżeli anonimizujesz dane treningowe na dużą skalę, praktycznym rozwiązaniem pośrednim jest zwykle licencjonowany silnik działający w ramach własnej orkiestracji. Nasz poradnik dotyczący procesów anonimizacji zbiorów danych do trenowania AI opisuje ten model, a artykuł o automatycznej anonimizacji wideo i obrazów wyjaśnia, jak zachowuje się etap detekcji przy dużej skali.
Dla większości zespołów uczciwy wniosek jest wąski: można stworzyć własne narzędzie, ale warto kupić gotowe, jeśli te 40 dni pracy inżynierskiej wolisz przeznaczyć na produkt, który faktycznie sprzedaje Twoja firma. Możesz zweryfikować to na własnych materiałach dzięki anonimizacji wideo w Gallio PRO.
FAQ
Czy rozmycie twarzy wystarcza, aby dane były anonimowe zgodnie z RODO?
Tylko wtedy, gdy rezultat przejdzie testy możliwości wyodrębnienia osoby, łączenia danych i wnioskowania określone w Opinii Grupy Roboczej Art. 29 nr 05/2014. Nieodwracalne rozmycie każdego elementu umożliwiającego identyfikację może spełnić ten wymóg. Częściowe lub odwracalne rozmycie oznacza, że dane nadal mają charakter danych osobowych, a RODO obowiązuje w pełnym zakresie.
Czy modele open source potrafią wykrywać tablice rejestracyjne równie dobrze jak twarze?
Nie w standardowej konfiguracji. Wykrywanie tablic jest odrębnym zadaniem, uwzględniającym charakterystyczne dla kraju układy i proporcje boków. Zwykle wymaga własnego modelu, własnych danych treningowych oraz oddzielnego zbioru ewaluacyjnego.
Ile czasu zajmuje stworzenie wewnętrznego pipeline’u do rozmywania twarzy?
Prototyp można stworzyć w ciągu kilku dni. Pipeline produkcyjny obejmujący śledzenie obiektów, obsługę kodeków, interfejs korekty i środowisko QA wymaga zazwyczaj 55-105 dni pracy inżynierskiej, a następnie 31-52 dni rocznie na utrzymanie.
Czy Gallio PRO automatycznie rozmywa tatuaże, identyfikatory lub ekrany?
Nie. Automatyczne wykrywanie obejmuje twarze i tablice rejestracyjne. Wszystkie pozostałe elementy można zanonimizować we wbudowanym edytorze ręcznym.
Czy Gallio PRO może działać bez połączenia z internetem?
Tak. Przetwarzanie odbywa się w całości lokalnie, na własnym sprzęcie, a oprogramowanie nie zapisuje dzienników detekcji ani danych osobowych.