Wer spricht da wirklich? Deepfakes kapern Videocalls

Wenn du in einem Zoom-Meeting manipuliert wirst, ohne es zu merken

Wie lassen sich Deepfake-Videos und Stimmen erkennen? Antworten finden Sie im Leitfaden Deepfakes.
Mimikama braucht Verstärkung – hilf uns, eine weitere Person ins Team zu holen
Wer spricht da wirklich? Deepfakes kapern Videocalls
Wer spricht da wirklich? Deepfakes kapern Videocalls

Der Elternabend, der keiner war – und die Täuschung in Echtzeit

Es ist ein gewöhnlicher digitaler Elternabend. Kamera an, Mikrofon funktioniert, die Lehrerin spricht über Hausaufgaben, Termine und Projekte. In der Runde sitzen viele bekannte Gesichter – oder zumindest scheinen sie das zu sein. Eine Mutter stellt Fragen zur Klassengröße, nickt zustimmend, wirkt präsent. Doch was keiner weiß: Sie ist nicht echt. Ihre Kamera zeigt keinen realen Menschen, sondern einen synthetischen Avatar, gesteuert von einer künstlichen Intelligenz. Die Stimme ist generiert, das Gesicht animiert – in Echtzeit. Ein Deepfake. Und niemand merkt es.

Solche Szenen wirken wie Science-Fiction, doch sie passieren bereits. Die Kombination aus Video-Deepfakes, Live-Gesichtsanpassung und KI-generierter Sprache ermöglicht es, in Echtzeit einen Menschen zu simulieren – mit täuschend echtem Aussehen, Mimik und Stimme. In Zoom-Calls, Google Meets oder Microsoft Teams. Besonders brisant: Die Fälschungen sind nicht mehr nur statische Videos, sondern dynamische, interaktive Maskierungen, mit denen sich Menschen als andere ausgeben können. Ohne dass die Teilnehmer des Gesprächs es erkennen.

Was früher Monate an Nachbearbeitung brauchte, funktioniert heute live mit gängigen Tools. Programme wie DeepFaceLive, Avatarify oder Synthesia erlauben es, beliebige Gesichter über die eigene Webcam zu legen, inklusive Lippenbewegung, Augenbewegung und Mimik. Kombiniert mit Voice-Cloning entsteht ein virtueller Mensch – präzise gesteuert, täuschend echt. Das Ziel: Zugang zu vertraulichen Gesprächen, Täuschung von Gruppen, gezielte Manipulation. Die Täuschung ist vollständig. Und der Schaden potenziell enorm.

So funktionieren Deepfakes in Videokonferenzen

Der Trick bei manipulierten Zoom-Calls liegt in der Echtzeit-Verarbeitung. Mittels KI-gestützter Gesichtserkennung wird das Bild eines realen oder erfundenen Menschen auf das Kamerabild des Angreifers gelegt. Die Bewegung der Augen, Lippen und des Kopfes wird live getrackt und synchronisiert. So entsteht der Eindruck, ein echter Mensch sei anwesend. Unterstützt durch Deepfake-Stimmen entsteht eine vollständige, interaktive Simulation.

Dabei sind zwei Varianten zu unterscheiden: die Imitation einer echten Person – etwa eines Lehrers, Kollegen oder Vorgesetzten – und die Erfindung einer komplett neuen Identität, z. B. ein neuer Elternteil, ein Meeting-Gast oder ein angeblicher Experte. In beiden Fällen ist die Wirkung ähnlich: Die Teilnehmer vertrauen dem Bild, glauben der Stimme, interagieren mit dem Avatar – und geben möglicherweise Informationen preis, die sie unter anderen Umständen nicht geteilt hätten.

Technisch ist das längst nicht mehr schwer. Selbst mit einem Mittelklasse-Laptop lassen sich heute Live-Deepfakes in hoher Qualität erzeugen, gestützt von Open-Source-Software und leicht verfügbaren Tutorials. Die Rechenpower, die einst Hollywood für Spezialeffekte brauchte, steckt inzwischen in vielen Wohnzimmern. Das macht die Gefahr so real: Jeder kann täuschen. Ohne teures Equipment. Ohne tiefes Fachwissen. Nur mit der Absicht, nicht erkannt zu werden.

Täuschung in der Normalität – und warum sie kaum auffällt

Das Perfide an Deepfake-Calls ist ihre Alltäglichkeit. Während wir Fotos oder vorproduzierte Videos noch kritisch betrachten, fehlt uns in Videocalls oft die Skepsis. Die Stimme klingt menschlich, das Gesicht reagiert, der Blickkontakt wirkt echt. In einem Bildschirm voll kleiner Kacheln wird kaum jemand bemerken, ob ein Gesicht minimal künstlich wirkt. Vor allem, wenn der Gesprächsverlauf ruhig, strukturiert und unauffällig bleibt.

Hinzu kommt ein psychologischer Faktor: Wir sind gewohnt, Menschen in Videokonferenzen nicht allzu genau zu betrachten. Die Kameraqualität ist oft gering, die Internetverbindung stockt, das Licht ist schlecht. All das schafft ideale Bedingungen für Deepfakes – kleine Unstimmigkeiten werden nicht als Täuschung, sondern als technische Probleme wahrgenommen. Und wer käme schon auf die Idee, dass der nette Vater im Elternabend gar nicht existiert?

Diese Form der Täuschung ist gefährlich, weil sie Zugang zu sensiblen Gruppen und Informationen erlaubt. In einem Schulmeeting können Daten über Kinder, Erziehungsmaßnahmen oder private Details offengelegt werden. In einem Unternehmen können interne Strategien oder Finanzpläne besprochen werden. Ein Deepfake-Teilnehmer kann all das mitschneiden, beeinflussen oder sogar lenken. Und hinterher? Lässt sich kaum beweisen, dass jemand nicht echt war – besonders wenn keine Aufzeichnung existiert.

Erste Vorfälle und wachsende Besorgnis

Einige Sicherheitsforscher und Tech-Medien berichten bereits von konkreten Fällen, in denen manipulierte Video-Avatare in Meetings aufgetreten sind. In einem Fall in Kanada wurde ein CEO-Meeting infiltriert, indem sich ein Angreifer als leitender Angestellter ausgab – Stimme und Bild wurden live manipuliert. Das Ergebnis: Vertrauliche Informationen flossen, der Schaden ging in die Millionen. Auch in Deutschland warnen IT-Sicherheitsfirmen inzwischen vor genau dieser Gefahr: Deepfakes in Meetings sind keine Theorie mehr – sie sind Praxis.

Trotzdem fehlt bislang eine breite öffentliche Debatte. Die meisten Menschen sind mit dem Konzept zwar vertraut, denken aber an virale Videos von Promis oder Politiker-Imitationen. Dass sie selbst in ihrem Alltag Ziel solcher Täuschungen werden könnten, ist kaum im Bewusstsein. Auch Plattformbetreiber wie Zoom oder Microsoft Teams bieten bislang keine zuverlässige Möglichkeit zur Verifizierung von Teilnehmern. Gesichtserkennung oder biometrische Checks wären datenschutzrechtlich heikel – bleiben aber die einzige Chance, tiefergehende Manipulation zu erkennen.

Ein weiteres Problem: Deepfakes hinterlassen kaum Spuren. Wenn der Call nicht aufgezeichnet wurde, lässt sich die Täuschung im Nachhinein schwer beweisen. Und selbst mit Aufzeichnung ist es technisch anspruchsvoll, synthetische Gesichter eindeutig zu identifizieren. Spezialisierte Forensik-Tools sind im Aufbau, aber nicht allgemein verfügbar. Das heißt: Die Gefahr ist real, der Schutz noch nicht. Und das Vertrauen in digitale Kommunikation steht auf dem Spiel.

Fazit: In deinem nächsten Zoom-Call könnte die Täuschung schon sitzen

Deepfakes in Videokonferenzen sind keine Zukunftsmusik mehr – sie sind ein neues Instrument der digitalen Täuschung. Sie nutzen unser Vertrauen, unsere Gewohnheit und unsere Unachtsamkeit. Sie klingen echt, sie sehen echt aus, sie wirken echt. Und genau das macht sie so gefährlich. Ob im Elternabend, im Firmenmeeting oder im Arztgespräch – wenn du nicht weißt, wer wirklich auf der anderen Seite sitzt, ist jeder Austausch riskant. Wir brauchen neue Formen digitaler Verifikation, ein geschärftes Bewusstsein – und die klare Erkenntnis: Nicht alles, was spricht und nickt, ist ein Mensch.

Relevante Beiträge:

Deepfakes – Täuschung per KI: Wenn du deinen Augen nicht mehr trauen kannst

Deepfake-Werbung erkennen: Wie fällt man nicht auf gefälschte Promis und Influencer rein?


Hinweis: Stand zum Veröffentlichungsdatum.
Verwendete Bilder, Screenshots und Medien dienen ausschließlich der sachlichen Auseinandersetzung im Sinne des Zitatrechts (§ 51 UrhG).
Teile dieses Beitrags können KI-gestützt erstellt und redaktionell geprüft worden sein.
(Mehr zur Arbeitsweise)