Kurzfassung: Wenn Ihr Team aufgezeichnete Videos oder Bilddatensätze verarbeitet und Gesichter sowie Kfz-Kennzeichen unkenntlich machen muss, ist ein eigener Detektor nur im ersten Monat günstiger. Wartung, Recall-Tests, Codec-Handling und Audit-Nachweise sind die Kosten, die sich über die Jahre aufsummieren. Gallio PRO ist eine On-Premise-Software zur Anonymisierung für Engineering-Leads, MLOps-Teams und Dataset-Verantwortliche, die diese Wartung lieber lizenzieren als dafür eigenes Personal vorzuhalten.
Die Entscheidung für Eigenentwicklung ist eine Wartungsentscheidung
Fast jedes Engineering-Team, das Anonymisierungssoftware bewertet, führt zuerst dieselbe interne Diskussion: Wir haben eine GPU, wir haben Python, ein vortrainierter Detektor plus Gaußscher Weichzeichner ist ein Wochenende Arbeit. Das stimmt. Ein funktionsfähiger Prototyp ist tatsächlich an einem Wochenende gebaut.
Der Prototyp ist aber nicht das Lieferergebnis. Das Lieferergebnis ist ein Prozess, der jeden Tag belastbare Ausgaben erzeugt, auch bei Aufnahmen, mit denen niemand gerechnet hat, und der dokumentiert, was aus welchem Grund unkenntlich gemacht wurde. Genau dieser Prozess muss über Jahre verantwortet, versioniert, getestet und personell abgesichert werden. Wenn Teams Eigenentwicklung gegen Kauf rechnen, kalkulieren sie meist das Wochenende und ignorieren das Jahrzehnt.
Was eine DIY-Pipeline tatsächlich kostet
Nachfolgend die Arbeit, die zwischen einem Prototyp und etwas liegt, das Sie einer Datenfreigabevereinbarung beilegen würden. Der Aufwand ist in Engineering-Tagen angegeben, damit Sie Ihren eigenen Vollkostensatz ansetzen können.
Arbeitspaket | Initiale Entwicklung | Jährlicher Wartungsaufwand |
Auswahl des Gesichtsdetektors, Anpassung der Schwellenwerte | 5 bis 10 Tage | 3 bis 5 Tage |
Kfz-Kennzeichenerkennung als separates Modell | 5 bis 15 Tage | 3 bis 5 Tage |
Temporale Glättung und Tracking über mehrere Frames | 10 bis 20 Tage | 4 bis 8 Tage |
Handling von Containern, Codecs und Rotationsmetadaten | 5 bis 10 Tage | 3 bis 6 Tage |
Oberfläche zur manuellen Korrektur übersehener Objekte | 15 bis 30 Tage | 5 bis 10 Tage |
Recall-Testdatensatz, QA-Framework, Regressionsläufe | 10 bis 15 Tage | 10 bis 15 Tage |
Dokumentation für Auditoren und Sicherheitsprüfungen | 5 Tage | 3 Tage |
Das sind rund 55 bis 105 Tage bis zur Gleichwertigkeit und danach 31 bis 52 Tage pro Jahr, nur um das Niveau zu halten. Eine Gallio PRO Standard-Lizenz kostet 89 EUR pro Monat oder 1.068 EUR pro Jahr mit dem Jahresrabatt. Der Break-even ist nicht knapp, und er verfehlt das Ergebnis um eine ganze Größenordnung.
Fünf Stellen, an denen DIY-Pipelines im Produktivbetrieb brechen
- Recall bei schwierigen Gesichtern. Offene Modelle schneiden bei frontalen, gut ausgeleuchteten Gesichtern aus mittlerer Entfernung gut ab. Reales Material besteht aus Profilansichten, Bewegungsunschärfe, Gegenlicht, niedriger Kameraposition und teilweiser Verdeckung. Ihr Demo-Datensatz enthält nicht Ihre Fehlerfälle.
- Kennzeichen sind ein zweites Problem. Die Erkennung von Kfz-Kennzeichen ist eine andere Aufgabe mit anderen Fehlermustern, anderen Seitenverhältnissen und länderspezifischen Layouts. Teams planen regelmäßig ein Modell ein und stellen dann fest, dass sie zwei brauchen.
- Konsistenz von Frame zu Frame. Ein Gesicht, das in den Frames 1 bis 40 erkannt und in den Frames 41 bis 43 übersehen wird, ergibt drei Frames mit offengelegter Identität. Die Genauigkeit im Einzelbild ist bei Video nicht die Kennzahl, auf die es ankommt.
- Container und Codecs. Rotationsmetadaten, variable Bildraten, der Erhalt der Audiospur und die Integrität der Zeitstempel sind unspektakulär, und genau daran scheitert die Abnahme beim Empfänger.
- Kein Korrekturpfad. Wenn die Automatisierung etwas übersieht, muss es vor der Freigabe jemand korrigieren. Ohne Editor bleiben als Rückfallebene eine Videoschnittsoftware und ein verlorener Nachmittag.
Eine ausführlichere Betrachtung der Erkennungsseite finden Sie in unserer Analyse zur Gesichtsverpixelung für den Datenschutz im Deep Learning.
Die Compliance-Lücke, die am meisten kostet
Unkenntlichmachung ist ein technischer Vorgang mit rechtlicher Folge, und die rechtliche Messlatte liegt höher, als die meisten Entwicklungspläne unterstellen.
- Erwägungsgrund 26 der DSGVO stellt wirklich anonyme Daten außerhalb des Anwendungsbereichs der Verordnung. Daten, die lediglich pseudonymisiert sind, bleiben darin, mit allen daran hängenden Pflichten.
- Stellungnahme 05/2014 der Artikel-29-Datenschutzgruppe legt die drei Tests fest, die jede Anonymisierungstechnik bestehen muss: Herausgreifen einzelner Personen, Verkettbarkeit und Ableitbarkeit. Reversible oder unvollständige Unkenntlichmachung fällt durch.
- Artikel 25 Absatz 1 DSGVO verlangt Datenschutz durch Technikgestaltung und durch datenschutzfreundliche Voreinstellungen. Die Unkenntlichmachung muss also der Standardzustand des Exports sein und kein manueller Schritt, den jemand vergessen kann.
- Artikel 32 Absatz 1 DSGVO fordert dem Risiko angemessene technische Maßnahmen und erwartet, dass Sie diese nachweisen können.
- Artikel 35 Absatz 3 Buchstabe c DSGVO löst eine Datenschutz-Folgenabschätzung aus, wenn öffentlich zugängliche Bereiche systematisch und umfangreich überwacht werden.
- EU AI Act, Verordnung (EU) 2024/1689, Artikel 5 verbietet das ungezielte Auslesen von Gesichtsbildern aus dem Internet oder aus Videoüberwachung zum Aufbau von Datenbanken zur Gesichtserkennung. Das verändert schon die Art, wie visuelle Datensätze überhaupt zusammengestellt werden dürfen.
Ein internes Skript hat keine Herstellerdokumentation, keine Validierung durch Dritte und kein Änderungsprotokoll, das eine Aufsichtsbehörde lesen kann. Sie schreiben alle drei selbst, oder Sie haben sie nicht, wenn danach gefragt wird.
So treffen Sie die Make-or-Buy-Entscheidung in sechs Schritten
- Definieren Sie den Umfang der Unkenntlichmachung schriftlich. Nur Gesichter, nur Kennzeichen oder beides. Notieren Sie separat, was sonst im Bild ist, etwa Ausweise, Bildschirme oder Dokumente, denn kein Tool erkennt das automatisch und es braucht einen manuellen Durchgang.
- Stellen Sie einen unfreundlichen Testdatensatz zusammen. Ziehen Sie 200 bis 500 Frames aus Ihren schlechtesten Bedingungen, nicht aus Ihren besten: Nacht, Regen, Weitwinkel, Tiefe in der Menschenmenge, fahrende Fahrzeuge.
- Messen Sie Recall, nicht Accuracy. Die Zahl, auf die es ankommt, sind übersehene Objekte pro tausend Frames. Ein einziges übersehenes Gesicht ist eine Offenlegung, unabhängig davon, wie gut der Durchschnitt aussieht.
- Kalkulieren Sie die Wartung, nicht die Entwicklung. Nehmen Sie die Spalte mit dem jährlichen Wartungsaufwand, multiplizieren Sie sie mit Ihrem Engineering-Vollkostensatz und vergleichen Sie das Ergebnis mit einer Jahreslizenz.
- Lassen Sie denselben Testdatensatz durch die Gallio PRO Demo laufen. Die Demo ist kostenlos und unbegrenzt nutzbar, mit Wasserzeichen versehen und auf 720p begrenzt. Das genügt, um den Recall an Ihrem eigenen Material zu messen, bevor Sie kaufen: Demo herunterladen.
- Entscheiden Sie über die Kosten pro Stunde verarbeitetem Material. Rechnen Sie die Zeit für manuelle Korrekturen in beiden Optionen mit ein. Diese eine Zahl beendet die meisten Make-or-Buy-Diskussionen.
Was Gallio PRO leistet und was nicht
Gallio PRO läuft vollständig auf Ihrem eigenen Rechner oder Server. Die Verarbeitung erfolgt lokal, das Material verlässt Ihre Infrastruktur also nie, und die Software speichert weder Erkennungsprotokolle noch personenbezogene Daten. Verfügbar ist sie als Desktop-Anwendung für Windows 10 und neuer, macOS 10.14 und neuer sowie Linux mit glibc 2.35 oder neuer, als Docker-Container und mit einer REST-API zur Integration in eine bestehende Pipeline. GPU-Beschleunigung bringt eine bis zu zehnmal schnellere Verarbeitung. Unterstützte Formate sind JPG und PNG für Bilder sowie MP4 und MOV für Video.
Die automatische Erkennung umfasst ausschließlich Gesichter und Kfz-Kennzeichen. Tattoos, Namensschilder, Firmenlogos, Dokumente und Monitorbildschirme werden nicht automatisch erkannt und werden im integrierten manuellen Editor bearbeitet, in dem Sie die Unkenntlichmachung vor dem Export auch gezielt wieder entfernen können. Gallio PRO verarbeitet aufgezeichnete Dateien und führt keine Live-Stream-Verarbeitung durch. Wenn Sie einen Live-Feed brauchen, ist das die falsche Werkzeugkategorie, und das sollten Sie früh sagen.
Wann sich die Eigenentwicklung doch lohnt
Drei Fälle rechtfertigen die Investition. Erstens: Die Unkenntlichmachung ist Ihr Produkt und nicht ein Schritt darin. Zweitens: Ihre primären Erkennungsziele sind Objekte, die kein kommerzielles Tool automatisiert, dann bauen Sie ohnehin einen Detektor. Drittens: Ihre Formate liegen außerhalb der üblichen Bild- und Videocontainer, etwa Rohdaten von Sensoren oder proprietäre Telemetrie. Für solche speziellen On-Premise- oder Compliance-Anforderungen können Sie Kontakt mit dem Team aufnehmen.
Wenn Sie Trainingsdaten in großem Umfang anonymisieren, ist der praktikable Mittelweg meist eine lizenzierte Engine innerhalb Ihrer eigenen Orchestrierung. Unser Leitfaden zu Anonymisierungsworkflows für KI-Trainingsdatensätze beschreibt dieses Muster, und automatisierte Video- und Bildanonymisierung erklärt, wie sich die Erkennungsstufe bei großen Mengen verhält.
Für die meisten Teams fällt die ehrliche Schlussfolgerung eng aus: Sie können es selbst bauen, und der Grund zu kaufen ist, dass Sie diese 40 Engineering-Tage lieber in das Produkt stecken, das Ihr Unternehmen tatsächlich verkauft. Diese Aussage können Sie mit Ihrem eigenen Material über die Videoanonymisierung von Gallio PRO überprüfen.
FAQ
Reicht das Verpixeln von Gesichtern aus, damit Daten nach DSGVO anonym sind?
Nur wenn das Ergebnis die Tests zu Herausgreifen einzelner Personen, Verkettbarkeit und Ableitbarkeit aus der Stellungnahme 05/2014 der Artikel-29-Datenschutzgruppe besteht. Eine irreversible Unkenntlichmachung aller identifizierenden Elemente kann diese Messlatte erreichen. Teilweise oder reversible Unkenntlichmachung lässt die Daten personenbezogen, und die DSGVO gilt weiterhin vollständig.
Können Open-Source-Modelle Kfz-Kennzeichen genauso gut erkennen wie Gesichter?
Nicht ohne Weiteres. Die Kennzeichenerkennung ist eine eigene Aufgabe mit länderspezifischen Layouts und Seitenverhältnissen, und sie braucht in der Regel ein eigenes Modell, eigene Trainingsdaten und einen eigenen Evaluierungsdatensatz.
Wie lange dauert es, eine Pipeline zum Verpixeln von Gesichtern intern aufzubauen?
Ein Prototyp dauert Tage. Eine produktionsreife Pipeline mit Tracking, Codec-Handling, Korrekturoberfläche und QA-Framework braucht typischerweise 55 bis 105 Engineering-Tage und danach 31 bis 52 Tage pro Jahr an Wartung.
Verpixelt Gallio PRO Tattoos, Ausweise oder Bildschirme automatisch?
Nein. Die automatische Erkennung umfasst Gesichter und Kfz-Kennzeichen. Alles andere wird im integrierten manuellen Editor unkenntlich gemacht.
Kann Gallio PRO ohne Internetverbindung laufen?
Ja. Die Verarbeitung erfolgt vollständig lokal auf Ihrer eigenen Hardware, und die Software speichert weder Erkennungsprotokolle noch personenbezogene Daten.