Eine Person sitzt an einem Schreibtisch mit mehreren Monitoren, die Code und Karten anzeigen, arbeitet in einem schwach beleuchteten Büro, das Gesicht unscharf, und eine Tasse steht in der Nähe.

Gesichter und Kennzeichen per REST-API und Docker automatisch unkenntlich machen: Batch-Pipelines für Teams mit hohem Volumen

Mateusz Zimoch
Veröffentlicht: 5.9.2026
Aktualisiert: 24.9.2026

Kurzfassung: Sobald das Volumen einige Hundert Dateien pro Monat übersteigt, ist nicht mehr die Erkennungsgeschwindigkeit der Engpass, sondern das Design von Warteschlangen, Wiederholungsläufen und Qualitätsgates. Gallio PRO bietet im Enterprise-Plan einen Docker-Container, eine Linux-Kommandozeile und eine REST-API, sodass die Anonymisierung in Ihrer eigenen Pipeline sitzen kann. Dieser Beitrag ist für MLOps-Engineers, Plattformteams und Dataset-Verantwortliche, die genau diese Pipeline bauen.

Drei Anzeichen dafür, dass die Desktop-Anwendung nicht mehr skaliert

Jeder Anonymisierungs-Workflow beginnt gleich: Jemand öffnet eine Datei, verarbeitet sie, prüft sie, exportiert sie. Das funktioniert, bis drei Symptome gleichzeitig auftreten.

Die Warteschlange ist eine Person. Arbeit kommt schneller herein, als eine einzelne Bearbeiterin sie abarbeitet, und die Priorisierung lebt im Posteingang von jemandem statt in einem System.

Es gibt keinen Wiederholungslauf. Ein Job, der bei 80 Prozent einer vierstündigen Datei scheitert, wird von Hand neu gestartet, von vorn, von demjenigen, der es bemerkt.

Es gibt keinen Nachweis. Niemand kann sagen, welche Dateien im letzten Quartal mit welchen Einstellungen verarbeitet wurden und wer den Export freigegeben hat. Das ist ein Problem der Rechenschaftspflicht, bevor es ein technisches ist, denn Artikel 5 Absatz 2 DSGVO verlangt, dass der Verantwortliche die Einhaltung nachweisen kann und sie nicht nur erreicht.

Leute, die in einem Kontrollraum arbeiten, nutzen mehrere Bildschirme und elektronische Geräte und konzentrieren sich darauf, verschiedene digitale Anzeigen zu überwachen.

Zwei Integrationsmuster

Muster A: überwachter Ordner plus Container

Dateien landen in einem Eingangsverzeichnis. Ein Container nimmt sie auf, verarbeitet sie, schreibt die Ausgabe in ein separates Verzeichnis und verschiebt die Quelle in einen Ablagebereich. Die Zeitsteuerung übernehmen cron, systemd oder Ihr Orchestrator.

Das passt zu Teams mit vorhersehbaren Batch-Fenstern, etwa einem nächtlichen Lauf über die Kameraexporte des Tages. Es ist das Muster mit dem geringsten Aufwand und braucht keine Anwendungsentwicklung. Gallio PRO unterstützt es über den Docker-Container und die Linux-Kommandozeile im Enterprise-Plan.

Muster B: REST-API, aufgerufen von Ihrem System

Ihr Fallmanagementsystem, Ihre Beweismittelplattform oder Ihr Labeling-Tool übergibt einen Job und bekommt das verarbeitete Ergebnis zurück. Die Unkenntlichmachung wird damit zu einem Schritt in einem bestehenden Workflow statt zu einem separaten Tool, an das jemand denken muss.

Das passt zu Teams, bei denen die Unkenntlichmachung durch ein Ereignis ausgelöst wird, etwa durch die Freigabe einer Exportanfrage, und bei denen das anfragende System Identitäten, Berechtigungen und Audit bereits verwaltet. Fordern Sie die API-Dokumentation an, bevor Sie dagegen entwerfen: Endpunktnamen, Authentifizierungsmethode, Größenlimits für Nutzdaten und die Frage, ob die Verarbeitung synchron oder jobbasiert läuft, prägen den Client, den Sie schreiben. Dafür können Sie Kontakt mit dem Team aufnehmen.

Person arbeitet an einem Laptop in einer industriellen Umgebung, schaut sich Diagramme an, umgeben von Maschinen und Geräten.

Die Pipeline in sieben Stufen

Stufe

Was sie tut

Wogegen sie schützt

1. Eingang

Datei annehmen, Prüfsumme und Quelle erfassen

Stille Duplikate und unerklärliche Dateien

2. Validierung

Format, Auflösung, Dauer und Codec prüfen

Jobs, die erst nach zwei Stunden scheitern

3. Warteschlange

Jobstatus mit Priorität persistent halten

Arbeit, die beim Neustart verloren geht

4. Verarbeitung

Erkennung und Unschärfe ausführen

Den Teil, an den ohnehin alle denken

5. QA-Gate

Stichprobe ziehen und vor der Freigabe prüfen

Übersehene Detektionen, die beim Empfänger landen

6. Export

An die anfragende Stelle ausliefern, Freigabe protokollieren

Nicht nachverfolgte Offenlegung

7. Löschung

Das Original fristgerecht löschen

Verstöße gegen die Speicherbegrenzung nach Artikel 5 Absatz 1 Buchstabe e

Die Stufen 2, 5 und 7 sind die, die Teams überspringen und später nachbauen. Unterstützte Eingabeformate sind JPG und PNG für Bilder sowie MP4 und MOV für Video, deshalb ist die Validierung in Stufe 2 eine billige Prüfung, die teure Fehlschläge spart.

Fünf technische Details, die über die Zuverlässigkeit entscheiden

  1. Idempotenz über den Content-Hash. Schlüsseln Sie Jobs auf die Prüfsumme der Quelldatei, nicht auf den Dateinamen. Kameraexporte kollidieren ständig in den Namen.
  2. Lange Dateien segmentieren. Teilen Sie mehrstündige Aufnahmen in Abschnitte, verarbeiten Sie diese und setzen Sie sie wieder zusammen. Ein Fehler kostet dann einen Abschnitt statt des ganzen Jobs.
  3. Parallelität an die Lizenzen binden. Die Floating-Lizenzierung im Enterprise-Plan bestimmt, wie viele Worker gleichzeitig laufen können. Setzen Sie den Worker-Pool auf diese Zahl und nicht auf Ihre Kernzahl.
  4. Scratch und Auslieferung trennen. Teilausgaben dürfen niemals in das Verzeichnis schreibbar sein, aus dem die anfragende Stelle abholt. Genau so gelangt unbearbeitetes oder halb bearbeitetes Material nach außen.
  5. Jobs protokollieren, nicht Personen. Erfassen Sie Dateihash, Einstellungen, Zeitstempel und die Identität der bearbeitenden Person. Bauen Sie kein Protokoll darüber, was erkannt wurde. Gallio PRO selbst speichert weder Erkennungsprotokolle noch personenbezogene Daten, und Ihre Pipeline sollte dieses Risiko nicht wieder einführen.
Schwarz-weißes Bild von Server-Racks mit Code-Overlay, das eine digitale und technologische Atmosphäre vermittelt.

Das QA-Gate ist nicht optional

Automatisierung verändert, wer prüft, nicht, ob geprüft wird. Bauen Sie ein ausdrückliches Gate mit drei Regeln: eine feste Stichprobenquote für Routine-Batches, eine vollständige Prüfung für alles, was an ein Gericht, eine Aufsichtsbehörde oder die Öffentlichkeit geht, und einen definierten Weg in den manuellen Editor für Ausnahmen.

Dieser Ausnahmeweg ist wichtig, weil die automatische Erkennung ausschließlich Gesichter und Kfz-Kennzeichen umfasst. Namensschilder, Monitorbildschirme, Dokumente, Tattoos und Logos werden im integrierten manuellen Editor unkenntlich gemacht, jede Datei mit solchen Inhalten verlässt den automatisierten Pfad also mit Absicht. Kennzeichnen Sie diese Kategorien nach Möglichkeit schon beim Eingang, über Kamerastandort oder Anfragetyp, damit sie geroutet und nicht erst am Gate entdeckt werden.

Volumenspezifische Hinweise finden Sie im Beitrag zur Anonymisierung großer Foto- und Videobestände. Stammt das Material aus einem Videomanagementsystem, behandelt der Beitrag zur Videoanonymisierung in VMS-Systemen die Integrationsaspekte.

So entwerfen Sie die Pipeline in sechs Schritten

  1. Schreiben Sie die Zustandsmaschine vor dem Code. Listen Sie jeden Jobstatus und jeden Übergang auf, einschließlich Fehlschlag und manueller Prüfung. Die meisten Pipeline-Defekte sind fehlende Zustände, keine schlechten Algorithmen.
  2. Fordern Sie API-Dokumentation und Container-Spezifikation an. Klären Sie Authentifizierung, Größenlimits für Nutzdaten, synchrone oder jobbasierte Verarbeitung und Exit-Codes, bevor Sie sich auf ein Design festlegen.
  3. Benchmarken Sie einen Worker mit Ihrem eigenen Material. Nutzen Sie die kostenlose Gallio PRO Demo, die unbegrenzt nutzbar ist und bis 720p mit Wasserzeichen arbeitet, um den Durchsatz eines einzelnen Workers zu ermitteln, und multiplizieren Sie ihn mit Ihrer lizenzierten Parallelität: Demo herunterladen.
  4. Definieren Sie das QA-Gate und seine Stichprobenquote. Schreiben Sie auf, wer prüft, in welcher Quote und was passiert, wenn eine Fehlstelle gefunden wird. Nehmen Sie den Weg über den manuellen Editor für Ausweise, Bildschirme und Dokumente mit auf.
  5. Instrumentieren Sie die Pipeline ohne personenbezogene Daten. Verfolgen Sie Durchsatz, Fehlerquote, Warteschlangentiefe und Zeit bis zur Auslieferung über Dateikennungen, nie über Erkennungsinhalte.
  6. Automatisieren Sie die Löschung. Planen Sie die Löschung der Originale und dokumentieren Sie den Plan. Eine automatisierte Pipeline, die nie etwas löscht, ist kein Effizienzgewinn, sondern eine wachsende Haftung.
Schwarz-weißes Bild eines Computerbildschirms, der Systemleistungsdaten und numerische Statistiken anzeigt, mit einem dunklen Hintergrund.

Wo das passt und wo nicht

Diese Architektur passt zu aufgezeichnetem Material, das in Stapeln verarbeitet wird: Kameraexporte, Beweismittelpakete, Archivrückstände und Trainingsdatensätze. Für bildlastige Dataset-Arbeit gelten dieselben Muster über die Bildanonymisierung mit Gallio PRO, typischerweise mit deutlich höheren Dateizahlen und kürzerer Verarbeitung pro Datei.

Für Live-Feeds passt sie nicht. Gallio PRO verarbeitet aufgezeichnete Dateien und führt keine Live-Stream-Verarbeitung durch, ein Pipeline-Entwurf, der einen kontinuierlichen Strom voraussetzt, braucht also eine andere Werkzeugkategorie. Sagen Sie das früh im Design-Review, statt es während der Integration zu entdecken.

Weil alles auf Ihrer eigenen Infrastruktur läuft, verlässt das Material Ihre Umgebung nie und es kommt keine externe Verarbeitungsabhängigkeit in Ihre Architektur, was auch die Compliance-Fläche klein hält. Bereitstellungsoptionen finden Sie auf der Seite zur Videoanonymisierung mit Gallio PRO.

Nahaufnahme einer Reihe schwarzer Server-Racks in einem Rechenzentrum, mit gedämpfter Beleuchtung, die die Metallkomponenten hervorhebt.

FAQ

Hat Gallio PRO eine API zur Automatisierung der Anonymisierung?

Ja. Eine REST-API, ein Docker-Container und eine Linux-Kommandozeile sind im Enterprise-Plan verfügbar. Fordern Sie die API-Dokumentation beim Anbieter an, bevor Sie Ihren Client entwerfen.

Kann die Anonymisierung in einem Container auf unseren eigenen Servern laufen?

Ja. Der Docker-Container ist die übliche Wahl für einen gemeinsam genutzten internen Verarbeitungsknoten, die Verarbeitung passiert dabei vollständig auf Ihrer eigenen Hardware.

Wie gehe ich mit Videodateien um, die stundenlang sind?

Segmentieren Sie sie in Abschnitte, verarbeiten Sie jeden Abschnitt unabhängig und setzen Sie sie wieder zusammen. Ein Fehler kostet dann einen Abschnitt statt des ganzen Jobs, und der Fortschritt übersteht Neustarts.

Brauche ich bei automatisierter Pipeline weiterhin eine menschliche Prüfung?

Ja. Bauen Sie ein ausdrückliches QA-Gate mit einer Stichprobenquote für Routine-Batches, vollständiger Prüfung für Material an Gerichte, Aufsichtsbehörden oder die Öffentlichkeit und einem Weg über den manuellen Editor für Objekte, die nicht automatisch erkannt werden.

Lässt sich die Anonymisierung auf einen Live-Kamerastream anwenden?

Nicht mit Gallio PRO. Es verarbeitet aufgezeichnete Dateien statt Livestreams, Pipelines sollten also um die Batch- oder ereignisgesteuerte Verarbeitung gespeicherten Materials herum entworfen werden.

Mateusz Zimoch

CEO und Mitbegründer von Gallio PRO, ist ein Ingenieur mit umfassender Expertise in Informatik, Datenwissenschaft, Robotik und künstlicher Intelligenz. Mateusz schloss sein Studium mit zwei Hauptfächern an der Technischen Universität Breslau ab und gründete zwei Start-ups, die sich auf die Entwicklung KI-gestützter Computer-Vision-Lösungen und den Bau ferngesteuerter Fahrzeuge (ROVs) konzentrieren.