Deepfakes erkennen und prüfen: warum Technik allein nicht reicht

Kurzfassung: Deepfakes technisch zu erkennen ist 2026 unzuverlässig: Menschen liegen beim Erkennen kaum über dem Zufall, und automatische Detektoren erreichen ihre hohen Laborwerte in der Praxis nicht, weil sie bei Kompression, neuen Generatoren und Echtzeit-Fälschungen einbrechen. Metadaten sind wertlos, weil sie sich fälschen oder entfernen lassen. Was wirklich trägt, ist keine einzelne Erkennung, sondern eine mehrschichtige Verteidigung: Detektion als eine Schicht, dazu Herkunftsnachweis, Verhaltenssignale, Geräteprüfung und vor allem prozessuale Verifikation über einen zweiten Kanal. Erkennungstechnik ist ein Baustein, kein Verlass.

Deepfakes erkennen und prüfen ist das Thema, bei dem der Wunsch nach einer technischen Lösung am größten und die Realität am ernüchterndsten ist. Nach dem Beitrag zu Deepfake-Vishing, der die Angriffsseite und die prozessuale Abwehr behandelt, geht es hier um die technische Frage: Kann man einem Bild, einer Stimme, einem Video ansehen, dass es gefälscht ist? Die kurze Antwort lautet: manchmal, nicht zuverlässig, und immer seltener. Dieser Beitrag ordnet ein, warum die menschliche und die automatische Erkennung an ihre Grenzen kommen, welche Ansätze es gibt und was jeder leistet, warum eine mehrschichtige Verteidigung die einzige tragfähige Antwort ist und was das für ein Blue Team konkret bedeutet. Die technische und gesellschaftliche Tiefe des Themas steht ausführlicher auf deepfake.de; hier geht es um die Verteidigersicht.

Warum das menschliche Auge versagt

Die erste unbequeme Wahrheit: Menschen erkennen moderne Deepfakes kaum besser als durch Raten. Studien zeigen Trefferquoten im Bereich von etwa 50 bis 60 Prozent, und daran ändern weder Training noch Erfahrung viel, weil die sichtbaren Fehler, an denen man Deepfakes früher erkannte, verschwunden sind. Die typischen Ratschläge aus älteren Awareness-Schulungen, auf unnatürliches Blinzeln, seltsame Schatten oder Fehler an den Zähnen zu achten, sind überholt: Aktuelle Generatoren machen diese Fehler nicht mehr, und bei einer Stimme im Telefonat unter Stress hat das Ohr ohnehin keine Chance. Wer seine Verteidigung darauf baut, dass ein aufmerksamer Mensch die Fälschung schon bemerken wird, baut auf eine Kontrolle, die statistisch nicht funktioniert.

Warum die Werkzeuge im Alltag schwächeln

Es gibt kommerzielle und akademische Detektoren, die Deepfakes an Artefakten erkennen: Kompressionsspuren, zeitliche Unstimmigkeiten über Videobilder hinweg, Auffälligkeiten in den höheren Frequenzbereichen einer Stimme. Sie funktionieren, aber mit drei ernüchternden Einschränkungen. Erstens der Laborsprung: Ein Detektor, der auf einem Forschungsdatensatz hohe Werte erreicht, fällt auf einem anderen, schwierigeren deutlich ab, und in der Praxis mit komprimierten, weitergeleiteten Inhalten noch weiter. Zweitens das Wettrüsten: Generatoren verbessern sich schneller, als Detektoren nachziehen; ein Detektor, der die heutige Generation erkennt, versagt bei der nächsten. Drittens die Selbstberichte: Fast jeder Anbieter nennt eine Genauigkeit nahe 99 Prozent, aber jede dieser Zahlen stammt aus einem Test, den der Anbieter selbst kontrolliert, mit einer Schwelle, die er selbst setzt; vergleichbar sind sie nicht, und nur unabhängige Benchmarks mit geheimen Referenzdaten sagen etwas aus. Besonders schwierig ist die Echtzeit-Erkennung: Ein Deepfake im laufenden Videocall muss während des Gesprächs erkannt werden, und viele Werkzeuge sind dafür zu langsam, sodass das Urteil erst nach dem Anruf kommt, wenn der Schaden schon da ist. Und Metadaten, früher ein Anker, sind wertlos geworden: Sie lassen sich entfernen oder fälschen, und ein Echtzeit-Deepfake hat dieselben Metadaten wie ein echtes Video.

Die Ansätze im Überblick

AnsatzWas er tutGrenze
Artefakt-DetektionSucht nach Spuren der KI-Erzeugung in Bild, Video oder TonBricht bei Kompression und neuen Generatoren ein, Laborwerte halten nicht
Liveness-PrüfungPrüft, ob ein echter Mensch live vor der Kamera ist (Kopfbewegung, Blinzeln)Aktive Prüfung stört Nutzer; fängt keine in Echtzeit erzeugten Gesichter und keine Injektionsangriffe
Herkunftsnachweis (Provenienz)Signiert Inhalte bei der Erstellung kryptografisch, etwa nach dem C2PA-StandardNur wirksam, wo Erstellung und Prüfung mitmachen; sagt nichts über unsignierte Inhalte
Verhaltens- und KontextsignaleAchtet nicht auf das Medium, sondern auf das Verhalten: ungewöhnliche Bitte, Zeitdruck, KanalbruchKein technischer Beweis, aber oft das verlässlichste Signal
Geräte- und InjektionsprüfungErkennt, ob ein Videostrom von einer echten Kamera oder eingespeist wurdeSpezialisiert auf Identitätsprüfung, nicht auf beliebige Anrufe

Der wichtigste Befund aus der Praxis: Kein einzelner dieser Ansätze reicht. Untersuchungen über viele Identitätsprüfungen hinweg zeigen, dass die meisten fortgeschrittenen Fälschungsversuche nur durch mehrere Erkennungsschichten zusammen gestoppt wurden. Eine einzelne Kontrolle, sei es Liveness oder ein Detektor, lässt die Organisation verwundbar, sobald der Angreifer weiß, was im Einsatz ist.

Die mehrschichtige Verteidigung

Weil keine einzelne Erkennung trägt, ist die Antwort ein Schichtmodell, in dem die technische Detektion nur eine Schicht ist und nicht die tragende.

  • Detektion als eine Schicht. Wo ein Detektor sinnvoll integrierbar ist, etwa im Mail-Gateway für Anhänge oder im Contact Center für Sprachströme, senkt er das Risiko, aber er ist nie der alleinige Schutz. Seine Grenzen gehören dokumentiert, damit niemand sich blind auf ihn verlässt.
  • Herkunftsnachweis, wo möglich. Der Standard C2PA erlaubt es, Inhalte bei der Erstellung kryptografisch zu signieren, sodass ihre Herkunft prüfbar ist. Das hilft nicht gegen jeden Angriff, aber es baut langfristig eine Infrastruktur des Vertrauens auf, in der unsignierte Inhalte auffälliger werden.
  • Verhaltens- und Kontextsignale. Das verlässlichste Signal ist oft nicht das Medium, sondern der Vorgang: eine ungewöhnliche Bitte, künstlicher Zeitdruck, ein Kanalbruch, eine Zahlung außerhalb des Prozesses. Diese Signale erkennt kein Detektor, aber ein wacher Prozess.
  • Prozessuale Verifikation über einen zweiten Kanal. Die Maßnahme, die auch dann greift, wenn jede Technik versagt: Rückruf über die hinterlegte Nummer, Vier-Augen-Prinzip für Zahlungen, ein Codewort. Weil kein Werkzeug das Zeitfenster zwischen Anrufbeginn und Urteil schließt, ist diese menschliche, prozessuale Schicht die tragende, wie im Beitrag zu Deepfake-Vishing ausgeführt.

Was das für ein Blue Team bedeutet

  • Keine Detektor-Illusion verkaufen. Wenn die Leitung nach einem Werkzeug fragt, das Deepfakes zuverlässig erkennt, ist die ehrliche Antwort, dass es das nicht gibt, und dass die Verteidigung deshalb bei den Prozessen liegt. Ein Detektor kann eine Schicht sein, aber wer ihn als Lösung verkauft, schafft ein falsches Sicherheitsgefühl.
  • Anbieter richtig prüfen. Wenn ein Detektor angeschafft wird, zählen unabhängige Benchmarks mit geheimen Referenzdaten, die Leistung auf komprimierten, realen Inhalten und die Echtzeitfähigkeit, nicht die selbstberichteten 99 Prozent aus dem Prospekt.
  • Awareness aktualisieren. Die alten Merkmale (Blinzeln, Schatten, Grammatik) gehören aus der Schulung gestrichen und durch die Verhaltenssignale und den Verifikationsprozess ersetzt. Das ist dieselbe Verschiebung, die auch der Meldeweg-Beitrag beschreibt.
  • Den Vorfall führen. Ist ein Deepfake-Betrug erfolgt, gilt der Incident-Response-Prozess: Zahlung stoppen, betroffene Konten prüfen, Anzeige, Meldepflichten. Der technische Nachweis der Fälschung ist dabei zweitrangig gegenüber der schnellen Reaktion.

Fazit

Deepfakes technisch zu erkennen ist 2026 ein Wettrüsten, das die Verteidigung nicht zuverlässig gewinnt: Das menschliche Auge versagt, die Werkzeuge halten ihre Laborwerte im Alltag nicht, und Metadaten sind wertlos. Die tragfähige Antwort ist keine bessere Erkennung, sondern eine mehrschichtige Verteidigung, in der Detektion, Herkunftsnachweis, Verhaltenssignale und Geräteprüfung zusammenwirken und die prozessuale Verifikation über einen zweiten Kanal die tragende Schicht bildet. Für ein Blue Team ist die wichtigste Erkenntnis, die Detektor-Illusion nicht mitzumachen und die Verteidigung dorthin zu legen, wo sie auch bei perfekter Fälschung hält: in die Prozesse. Die technische Tiefe zu Erkennung, Herkunftsnachweis und der Entwicklung der Generatoren steht auf deepfake.de.

Dieser Beitrag beschreibt Erkennungsansätze und Schutzmaßnahmen allgemein und ersetzt keine individuelle Sicherheitsberatung.

NH

$ whoami

Norbert Hofmann

Cyber Defense Analyst im Security Operations Center eines Managed Security Service Providers. Red und Blue Teaming, Malware-Analyse, Incident Response und Security-Awareness-Trainings. Finalist bei „Deutschlands bester Hacker“ 2022, mehrere CVE-Einträge für WordPress-Plugins.