Deepfakes: Wie generative KI Fakes erzeugt

Deepfakes: Wie generative KI Fakes erzeugt

Ein Video zeigt einen Politiker, der Dinge sagt, die er nie gesagt hat. Ein Anruf klingt exakt wie die Stimme des Chefs. Ein Foto zeigt eine Person in einer Situation, in der sie nie war. Was früher aufwendige Studioarbeit erforderte, lässt sich heute mit einem durchschnittlichen Gaming-PC und frei verfügbarer Software in wenigen Stunden erzeugen. Generative KI hat die Hürde für digitale Fälschungen auf ein Niveau gesenkt, das vor fünf Jahren kaum vorstellbar war.

Was Deepfakes technisch ausmacht

Der Begriff „Deepfake“ setzt sich aus „Deep Learning“ und „Fake“ zusammen. Dahinter steckt kein einzelnes Verfahren, sondern eine Familie von Methoden, die alle auf neuronalen Netzen basieren. Der entscheidende Durchbruch kam mit den sogenannten Generative Adversarial Networks, kurz GANs. Ian Goodfellow veröffentlichte das Grundkonzept bereits 2014, doch erst ab 2017 wurde es für Deepfakes breit eingesetzt, als ein Reddit-Nutzer unter dem Pseudonym „deepfakes“ erste Gesichtstausch-Videos hochlud.

Ein GAN besteht aus zwei konkurrierenden neuronalen Netzen: dem Generator und dem Diskriminator. Der Generator erzeugt synthetische Bilder, der Diskriminator versucht, echte von gefälschten Inhalten zu unterscheiden. Beide trainieren sich gegenseitig, bis der Generator Ausgaben produziert, die der Diskriminator nicht mehr zuverlässig erkennen kann. Das Ergebnis sind Bilder oder Videoframes, die für das menschliche Auge kaum von echtem Material zu unterscheiden sind.

Encoder, Decoder und das Training auf Gesichtsdaten

Für Gesichtstausch-Videos, die häufigste Form von Deepfakes, werden oft Autoencoder-Architekturen eingesetzt. Dabei lernt ein Encoder, die wesentlichen Merkmale eines Gesichts in einem komprimierten Datensatz zu speichern. Zwei separate Decoder rekonstruieren jeweils ein anderes Gesicht aus demselben komprimierten Datensatz. Tauscht man die Decoder, erhält man das Gesicht von Person A auf dem Körper von Person B, inklusive Mimik und Kopfbewegungen.

Für ein überzeugend wirkende Ergebnis sind je nach Methode zwischen 300 und mehreren tausend Trainingsbilder der Zielperson notwendig. Bei Prominenten, Politikern oder Medienpersönlichkeiten ist dieses Material aus öffentlichen Quellen leicht verfügbar. Die Software DeepFaceLab, die auf GitHub kostenlos heruntergeladen werden kann, benötigt für ein brauchbares Ergebnis etwa 12 bis 24 Stunden Training auf einer GPU der Mittelklasse, beispielsweise einer NVIDIA RTX 3070.

Wer sich genauer mit der Technik hinter Deepfakes befassen möchte, findet dort einen strukturierten Überblick über Architekturtypen, Trainingsprozesse und aktuelle Detektionsmethoden.

Diffusionsmodelle als neue Stufe der Qualität

GANs haben seit 2022 starke Konkurrenz durch Diffusionsmodelle bekommen. Stable Diffusion, Midjourney oder DALL-E 3 arbeiten nach einem anderen Prinzip: Sie lernen, aus verrauschten Bildern schrittweise scharfe, kohärente Darstellungen zu erzeugen. Die Bildqualität übertrifft in vielen Fällen klassische GAN-Ausgaben erheblich, und die Kontrolle über Stil, Komposition und Details ist präziser geworden.

Für Deepfakes im eigentlichen Sinne werden Diffusionsmodelle häufig mit zusätzlichen Techniken kombiniert, etwa mit ControlNet, das Pose und Gesichtsstruktur einer Zielperson als Vorlage nutzt. So lassen sich fotorealistische Bilder erzeugen, die eine reale Person in beliebigen, vollständig erfundenen Situationen zeigen. Der Rechenaufwand dafür ist auf aktueller Konsumentenhardware mit 8 GB VRAM und mehr gut handhabbar.

Einsatzgebiete zwischen Kreativwirtschaft und Kriminalität

Nicht jede Anwendung generativer KI ist problematisch. In der Filmpostproduktion werden ähnliche Verfahren genutzt, um Schauspieler zu verjüngen, Stuntmen zu ersetzen oder verstorbene Darsteller für kurze Szenen zu rekonstruieren. Der Film „Rogue One“ (2016) nutzte frühe Versionen dieser Technologie für die Darstellung von Peter Cushing, der 1994 verstorben war.

  • Politische Desinformation: Im Vorfeld der slowakischen Parlamentswahl 2023 kursierten gefälschte Audioclips, die einen Kandidaten beim Gespräch über Wahlmanipulation zeigten. Das Material verbreitete sich innerhalb von Stunden über soziale Netzwerke.
  • Finanzbetrug: 2024 berichteten mehrere Unternehmen aus Hongkong und Deutschland von Fällen, in denen Kriminelle per Videokonferenz als Führungskräfte auftraten und Überweisungen in Millionenhöhe anwiesen.
  • Non-Consensual Intimate Images (NCII): Das britische Internet Watch Foundation schätzt, dass 2023 über 90 Prozent der im Netz kursierenden Deepfakes explizite Darstellungen realer Personen ohne deren Einwilligung waren.
  • Identitätsdiebstahl: Gefälschte Ausweisdokumente und Gesichtsbilder werden genutzt, um KYC-Prozesse (Know Your Customer) bei Banken und Kryptobörsen zu umgehen.

Erkennung: Wo Detektoren stehen und wo sie versagen

Die Forschung zur Deepfake-Erkennung ist ein Wettrüsten. Microsoft, Meta und mehrere Universitäten haben Detektionsmodelle veröffentlicht, die spezifische Artefakte analysieren: unnatürliche Lidschlagfrequenz, inkonsistente Beleuchtung auf Haaren und Ohren, Farbabweichungen an Gesichtsrändern oder Anomalien in der Tiefenschärfe. Facebooks „FaceForensics++“ Datensatz enthält über eine Million manipulierte Videoframes und dient als Benchmark für Erkennungsmodelle.

Das grundlegende Problem: Jede neue Generationsarchitektur produziert andere Artefakte als ihre Vorgänger. Ein Detektor, der auf GAN-Fakes trainiert wurde, erkennt Diffusionsmodell-Fakes oft nicht zuverlässig. In Tests des AI-Forschungslabors MIT Media Lab aus dem Jahr 2023 lagen die Erkennungsraten aktueller Detektoren bei modernen Deepfakes teilweise unter 60 Prozent, was kaum besser ist als zufälliges Raten bei einem Zwei-Klassen-Problem.

Was Hardware damit zu tun hat

Für alle, die Hardware-Systeme planen oder betreiben, ist das Thema relevanter als es zunächst scheint. Deepfake-Erkennung in Echtzeit, etwa an Eingangsscannern oder in Videokonferenzsystemen, stellt erhebliche Anforderungen an Rechenleistung. Dedizierte NPUs in aktuellen Prozessoren wie dem AMD Ryzen AI 9 HX 370 oder Intels Core Ultra Serie sind explizit für solche Inferenzaufgaben ausgelegt. Gleichzeitig machen günstige GPUs mit hohem VRAM die Erzeugung von Deepfakes zugänglicher, was die Angreifer-Seite stärkt.

Unternehmen, die biometrische Zugangssysteme oder Videokonferenzlösungen einsetzen, sollten prüfen, ob die genutzten Systeme aktuelle Liveness-Detection-Mechanismen unterstützen. Viele ältere Systeme sind auf statische Bildfälschungen ausgelegt und erkennen video-basierte Angriffe nicht. Das ist keine theoretische Bedrohung mehr, sondern ein dokumentiertes Angriffsmuster mit nachgewiesenen Schadensfällen.

Generative KI ist eine der leistungsfähigsten Technologien, die in der Geschichte der Computertechnik für Endnutzer zugänglich gemacht wurde. Das ändert nichts daran, dass ein erheblicher Teil ihrer praktischen Anwendungen im Bereich des Deepfake-Missbrauchs liegt. Wer Systeme entwirft, betreibt oder kauft, die auf Identitätserkennung oder Videoauthentizität angewiesen sind, sollte diesen Stand der Technik kennen und einkalkulieren.

Kommentar verfassen

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert