Deepfake-Vishing aus Blue-Team-Sicht: was das SOC sehen kann

Kurzfassung: Deepfake-Vishing ist CEO-Fraud mit geklonter Stimme oder gefälschtem Video: Ein Anruf oder Videocall gibt sich als Geschäftsführung aus und drängt auf eine dringende Überweisung oder die Weitergabe eines MFA-Codes. Das SOC sieht davon fast nichts, weil der Angriff über Telefon und Prozesse läuft, nicht über das Netzwerk. Was das Blue Team beitragen kann, sind die Spuren um den Anruf herum, ein Meldeweg und die Vorarbeit, damit die eigentliche Abwehr greift: eine prozessuale Zweitverifikation über einen unabhängigen Kanal.

Deepfake-Vishing ist die Angriffsform, bei der ein Blue Team seine eigenen Grenzen am deutlichsten spürt. Ein SOC ist darauf gebaut, Angriffe in Logs zu erkennen; ein Anruf mit geklonter Stimme hinterlässt keine Logs, die etwas über seine Echtheit verraten. Trotzdem ist die Bedrohung real und wächst schnell, und das Blue Team hat eine Rolle, nur eine andere als sonst: nicht die Erkennung des Angriffs selbst, sondern die Spuren drumherum, der Meldeweg und die Vorbereitung der Prozesse, die den Angriff stoppen. Dieser Beitrag ordnet die Bedrohung ein, zeigt, was das SOC tatsächlich sehen kann und was nicht, warum Erkennungstechnik als alleinige Kontrolle scheitert, und welche prozessualen Maßnahmen wirken. Er behandelt Deepfakes aus der Verteidigersicht; die Technik dahinter und ihre gesellschaftliche Dimension sind ein eigenes Thema, das auf deepfake.de ausführlicher steht.

Was Deepfake-Vishing ist und warum es jetzt kommt

Vishing, das Voice-Pendant zum Phishing, ist alt; neu ist die geklonte Stimme. Der klassische CEO-Fraud kam per E-Mail: der vermeintliche Geschäftsführer bittet die Buchhaltung um eine dringende Überweisung, die Absenderadresse gefälscht, der Text oft holprig. Deepfake-Vishing hebt denselben Betrug auf die Telefon- und Videoebene, wo es keine Absenderadresse zum Prüfen und keine Tippfehler zum Stolpern gibt, nur eine vertraute Stimme, die unter Zeitdruck etwas verlangt. Der Grund für die plötzliche Verbreitung ist die gesunkene Einstiegsschwelle: Eine Stimme lässt sich aus wenigen Sekunden öffentlich verfügbaren Audiomaterials klonen, und jede Aufzeichnung einer Rede, eines Podcasts oder einer Telefonkonferenz liefert dieses Material. Offene Modelle laufen auf einem normalen Laptop und erzeugen aus einem kurzen Sample eine Stimme, die im Telefonat unter Stress nicht mehr von der echten zu unterscheiden ist. Das Referenzbeispiel ist der Fall des Ingenieurbüros Arup, das im Mai 2024 bestätigte, durch einen gefälschten Videocall mit einem synthetischen CFO und synthetischen Kollegen umgerechnet rund 25 Millionen Dollar verloren zu haben; seither ist die Masche keine Ausnahme mehr.

Für den deutschsprachigen Raum warnen BKA und BSI seit 2024 verstärkt vor Voice-Cloning-Angriffen auf Unternehmen, und das Bundeslagebild des BKA führt Voice-Cloning inzwischen als eigenständiges Tatmittel beim CEO-Fraud. Besonders gefährdet gelten mittelständische Betriebe mit flachen Hierarchien und kurzen Wegen zwischen Geschäftsführung und Buchhaltung, weil dort eine direkte Anweisung von oben wenig ungewöhnlich ist. Die Dunkelziffer ist hoch, weil viele Betroffene die Fälle nicht öffentlich machen.

Was das SOC sehen kann und was nicht

Die unbequeme Wahrheit zuerst: Den Voice-Clone selbst erkennt kein Detection-System. Der Anruf kommt über das Telefonnetz oder eine Videoplattform, das SIEM sieht ihn nicht, und automatische Deepfake-Erkennung ist im realen Einsatz unzuverlässig. Was das SOC sehen kann, sind die Spuren, die ein solcher Angriff im Umfeld hinterlässt, denn ein Anruf allein reicht dem Angreifer selten; er bereitet ihn vor und setzt ihn in einen Kontext.

  • Die Aufklärung davor. Bevor der Anruf kommt, sammelt der Angreifer Informationen: wer in der Buchhaltung sitzt, wer zeichnungsberechtigt ist, wann die Geschäftsführung auf Reisen und schwer erreichbar ist. Ein Teil davon läuft über Phishing, gefälschte Anfragen an das Impressum oder das Abgreifen von Abwesenheitsnotizen, und genau das sieht das SOC in den Mail- und Anmeldelogs.
  • Der begleitende Kanal. Häufig folgt auf den Anruf eine E-Mail mit den Bankdaten oder umgekehrt, und diese Mail hat einen Absender, einen Weg und einen Zeitpunkt, die im Mail-Gateway auftauchen. Ein Anruf der „Geschäftsführung“ und kurz darauf eine Mail von einer ähnlich aussehenden Domain sind zusammen ein Muster.
  • Die Kontoübernahme als Vorstufe. Manche Angriffe klonen nicht nur die Stimme, sondern übernehmen zuvor ein echtes Konto, um aus dem echten Postfach oder dem echten Teams-Account zu schreiben. Das ist ein kompromittiertes Konto, und das sieht das SOC über Anmeldungen aus ungewohnten Regionen, neue Postfachregeln und MFA-Anomalien.
  • Die Reaktion danach. Wurde ein MFA-Code am Telefon weitergegeben, folgt eine Anmeldung, und die ist sichtbar. Wurde eine Überweisung ausgelöst, ist das kein SOC-Ereignis, aber die Meldung der Buchhaltung an das SOC ist der Auslöser für den Incident-Response-Prozess.

Das Blue Team erkennt Deepfake-Vishing also nicht am Anruf, sondern an dem, was davor, daneben und danach im Netz passiert. Diese Einordnung ist wichtig, weil sie vor der falschen Hoffnung schützt, ein Werkzeug könne das Problem lösen.

Warum Erkennungstechnik als alleinige Kontrolle scheitert

Es gibt Werkzeuge, die geklonte Stimmen an Artefakten in der Spektralanalyse erkennen wollen, etwa an fehlenden Atemgeräuschen oder Auffälligkeiten in hohen Frequenzbereichen. Im Labor funktionieren sie, im Alltag deutlich schlechter, und die Qualität der Klone steigt schneller als die der Detektoren. Zwei Zahlen ordnen das ein: Die menschliche Trefferquote beim Erkennen hochwertiger Deepfakes liegt niedrig, und automatische Erkennungswerkzeuge verlieren beim Sprung vom Labor in die Praxis einen erheblichen Teil ihrer Genauigkeit. Wer die Abwehr an ein Erkennungswerkzeug hängt, baut auf eine Kontrolle, die genau dann versagt, wenn sie gebraucht wird. ENISA und BSI zählen Social Engineering mit KI und Deepfakes zu den zentralen Bedrohungen, und beide betonen dieselbe Konsequenz: Prozesse schlagen Technik.

Auch Awareness allein reicht nicht. Ein Mitarbeiter, der in einer Krisensituation die vertraute Stimme des Chefs hört, glaubt ihr, und kein Training ändert etwas an dieser menschlichen Grundtatsache. Awareness senkt die Wahrscheinlichkeit, ersetzt aber keine Kontrolle, die auch dann greift, wenn die Überzeugung schon da ist.

Was wirklich wirkt: prozessuale Zweitverifikation

Die Maßnahme, die die Fachwelt übereinstimmend empfiehlt und die auch das BSI als erste Schutzmaßnahme nennt, ist eine unabhängige Rückbestätigung über einen zweiten Kanal, fest im Prozess verankert, nicht dem Bauchgefühl überlassen. Konkret:

  • Rückruf über die hinterlegte Nummer. Jede telefonische oder per Video übermittelte Zahlungsanweisung wird bestätigt, indem der Mitarbeiter unter der im Verzeichnis hinterlegten Nummer zurückruft, nie unter einer Nummer, die der Anrufer nennt. Der Angreifer kontrolliert seinen Kanal, nicht den hinterlegten.
  • Vier-Augen-Prinzip für Zahlungen und Bankdatenänderungen. Keine Überweisung über einer Schwelle und keine Änderung einer hinterlegten Bankverbindung ohne zweite, unabhängige Freigabe. Das ist die Kontrolle, die auch dann hält, wenn eine Person getäuscht wurde.
  • Codewort für ungewöhnliche Anfragen. Ein intern vereinbartes Codewort, das bei dringenden, aus dem Rahmen fallenden Anweisungen abgefragt wird. Für Privatpersonen empfehlen BSI und Verbraucherzentralen dasselbe gegen den „Enkeltrick 2.0“, und im Unternehmen funktioniert es genauso.
  • MFA-Codes werden nie weitergegeben. Eine klare, ausnahmslose Regel: Niemand, auch nicht der Chef am Telefon, bekommt einen MFA-Code genannt. Wer danach fragt, ist per Definition ein Angreifer.
  • Drängen auf Eile ist das Warnsignal. Der gemeinsame Nenner aller dieser Angriffe ist der künstliche Zeitdruck, der die Zweitverifikation verhindern soll. Die Regel, dass gerade eine dringende, geheime Anweisung die Verifikation auslöst statt sie zu überspringen, dreht den Hebel des Angreifers um.

Diese Maßnahmen kosten kein Werkzeug, sondern eine Prozessänderung und deren Einübung, damit sie im Ernstfall unter Stress abgerufen wird. Genau darin liegt die Rolle des Blue Teams jenseits der Logs.

Die Rolle des Blue Teams

  • Den Meldeweg bereitstellen. Wenn jemand nach einem verdächtigen Anruf unsicher ist, muss klar sein, wohin er sich wendet, und die Antwort muss dieselbe niedrige Schwelle haben wie beim Phishing: lieber einmal zu viel melden. Das SOC ist die Stelle, die aus einer solchen Meldung sofort die begleitenden Spuren im Netz prüft.
  • Die Spuren korrelieren. Kommt eine Meldung, sucht das SOC nach dem, was das Blue Team sehen kann: verdächtige Mails im selben Zeitraum, Anmeldungen an betroffenen Konten, MFA-Anomalien, neue Postfachregeln. Aus dem Anruf, den niemand belegen kann, wird so ein Vorfall mit überprüfbaren Elementen.
  • Die Angriffsfläche verkleinern. Das Blue Team kann darauf hinweisen, wie viel Audiomaterial der Geschäftsführung öffentlich verfügbar ist und dass jede Aufzeichnung Trainingsmaterial wird. Ganz vermeiden lässt sich das nicht, aber es gehört in die Risikobetrachtung.
  • Den Vorfall führen. Ist Geld geflossen oder ein Code weitergegeben worden, gilt der Incident-Response-Prozess: Zahlung sofort über die Bank zu stoppen versuchen, betroffene Konten sperren, Anzeige bei der Zentralen Ansprechstelle Cybercrime, und je nach Datenbezug die Meldepflichten prüfen.
  • Die Übung liefern. Deepfake-Vishing gehört in die Tabletop-Übung: Wie reagiert die Buchhaltung auf den dringenden Anruf des CFO, greift die Zweitverifikation, weiß jeder, wen er anruft? Das ist die Übung, die den Prozess von der Richtlinie in die Reaktion bringt.

Fazit

Deepfake-Vishing ist der Fall, in dem das Blue Team am ehrlichsten sagen muss, wo seine Erkennung endet: Den Anruf mit der geklonten Stimme sieht das SOC nicht, und kein Werkzeug ändert das zuverlässig. Was das Blue Team sieht, sind die Spuren drumherum, und was den Angriff wirklich stoppt, ist eine prozessuale Zweitverifikation, die vor dem Ernstfall eingeübt sein muss. Die Rolle des Blue Teams verschiebt sich hier von der Erkennung zur Vorbereitung, zum Meldeweg und zur Übung, und das ist keine kleinere Rolle, sondern die passende. Wer tiefer in die Technik hinter Deepfakes, ihre Erkennung und die gesellschaftliche Seite einsteigen will, findet das auf deepfake.de; für das SOC gilt: Prozesse schlagen Technik. Warum die technische Erkennung allein nicht trägt, steht im Beitrag Deepfakes erkennen und prüfen. Die technische Seite des Stimmklonens vertieft Voice-Cloning und CEO-Fraud.

Dieser Beitrag beschreibt Angriffsmuster und Schutzmaßnahmen allgemein und ersetzt keine individuelle Sicherheits- oder Rechtsberatung.

NH

$ whoami

Norbert Hofmann

Cyber Defense Analyst im Security Operations Center eines Managed Security Service Providers. Red und Blue Teaming, Malware-Analyse, Incident Response und Security-Awareness-Trainings. Finalist bei „Deutschlands bester Hacker“ 2022, mehrere CVE-Einträge für WordPress-Plugins.