Une arnaque crypto par deepfake IA utilise une voix clonée ou une vidéo en direct d’un fondateur connu pour vous pousser à envoyer des fonds, à signer une transaction ou à cliquer sur un lien malveillant. La défense qui fonctionne vraiment n’est pas une meilleure détection vidéo. C’est la règle de vérification hors canal : ne faites jamais confiance au canal par lequel on vous a contacté, et confirmez toute instruction via un second canal auquel vous faites déjà confiance.
Points clés
- La vidéo deepfake en temps réel est désormais assez bon marché pour des arnaques ponctuelles. Environ cinquante heures d’images publiques et un GPU grand public suffisent à créer un imitateur interactif capable de tromper des personnes lors d’un appel Zoom en direct.
- Le clonage vocal est la partie la plus petite, mais la plus inquiétante. Un échantillon de trente secondes d’une personne en train de parler suffit à générer une voix convaincante, ce qui explique l’explosion des faux appels audio et des faux X Spaces.
- Les faux cadeaux en livestream sont une attaque distincte destinée au grand public. Les escrocs détournent ou copient des chaînes YouTube ou X légitimes, rediffusent un clip deepfake d’un fondateur et dirigent les spectateurs vers un site qui vide les wallets.
- La défense est procédurale, pas technique. La vérification hors canal, c’est-à-dire raccrocher puis rappeler via un numéro ou un canal auquel vous faites déjà confiance, neutralise toutes les variantes de cette attaque.
Ce qu’est vraiment une arnaque crypto par deepfake IA
Une arnaque crypto par deepfake IA est une fraude qui utilise un clone généré par IA d’une personne réelle, généralement un fondateur, un dirigeant ou un influenceur, afin de convaincre une victime d’envoyer de la cryptomonnaie, d’approuver une signature de wallet malveillante ou de divulguer une seed phrase. Le clone peut être une vidéo, une voix audio, ou les deux, et il est de plus en plus souvent utilisé en temps réel pendant une conversation en direct plutôt que sous forme de clip préenregistré.
Cette catégorie existait en théorie depuis des années, mais elle est passée des démonstrations de recherche aux attaques réelles en 2024 et 2025. Deux choses ont changé en même temps. D’abord, les modèles open source de réanimation faciale et de synthèse vocale sont devenus peu coûteux et performants. Ensuite, crypto Twitter, les X Spaces, les livestreams YouTube et les appels AMA de projets ont laissé derrière eux d’immenses archives publiques de fondateurs en train de parler. Ces images et enregistrements constituent les données d’entraînement.
Le but de cet article n’est pas de vous effrayer au sujet des deepfakes en général. Il s’agit de détailler le déroulement réel de l’attaque décrit par de vraies victimes, de montrer quels signaux sont faciles à falsifier et lesquels ne le sont pas, puis d’enseigner une habitude procédurale qui rend toute cette catégorie inefficace contre vous. Si vous ne devez retenir qu’une seule chose, retenez la règle de vérification hors canal à la fin.
Les vrais risques : ce que les victimes perdent réellement
Avant les mécanismes, il est utile de voir ce qui se passe mal lorsque des personnes se font piéger. Le schéma est constant, car l’attaque repose sur l’urgence, l’autorité et une seule action irréversible.
Appels individuels en direct
La version la plus coûteuse est l’appel individuel en direct. Une cible, souvent un contributeur précoce d’un projet plus petit, reçoit un message direct d’une personne prétendant être un fondateur important et proposant du mentorat ou une opportunité. Ils passent sur un appel Zoom ou Telegram. La vidéo et la voix de l’autre personne sont un deepfake. La conversation s’oriente vers une signature de wallet qui ressemble à une approbation standard, mais qui est en réalité une autorisation permettant de vider les tokens. La cible signe. Les fonds disparaissent en quelques minutes, et les annulations on-chain sont presque toujours impossibles.
Faux cadeaux en livestream
La version grand public est un faux livestream. Les escrocs détournent une vraie chaîne YouTube, achètent un compte X à l’apparence vérifiée ou rediffusent un enregistrement volé d’un vrai fondateur. Le fondateur apparaît à l’écran en disant que toute personne envoyant du BTC ou de l’ETH à une adresse de wallet recevra le double en retour. L’adresse est contrôlée par l’escroc. Des rapports de Chainalysis et d’enquêteurs on-chain ont montré à plusieurs reprises que ces opérations peuvent rapporter des montants à cinq à sept chiffres en un seul stream de plusieurs heures.
Attaques uniquement vocales contre les équipes
Le clonage vocal a été utilisé pour appeler des employés de projets crypto, principalement dans des fonctions finance et opérations, en se faisant passer pour un fondateur ou un investisseur principal. L’appelant demande un virement urgent, un mouvement de trésorerie ou un déblocage anticipé de tokens. Comme la voix est correcte et que la demande correspond à un flux de travail interne plausible, l’employé agit. Ces cas ont été signalés dans au moins deux entreprises cotées liées de près ou de loin à la crypto, avec des pertes de plusieurs millions par incident.
Le point commun entre les trois est que le problème de détection technique est difficile et le devient encore plus. La défense procédurale est la même et devient plus facile. Nous y reviendrons.
Comment les escrocs construisent un imitateur convaincant
La chaîne technique d'une arnaque au deepfake en tête-à-tête est plus accessible que la plupart des gens ne l'imaginent. Vous n'avez pas besoin d'un acteur étatique. Il vous faut de la patience, quelques outils open source et une cible qui s'est exprimée publiquement depuis quelques années.
Collecte des séquences d'entraînement
La première étape consiste à aspirer l'audio et la vidéo publics de la cible. La liste des sources est longue et bien connue des attaquants. Audio de X Spaces et Twitter Spaces, interviews YouTube et AMA, conférences sur YouTube et Rumble, participations à des podcasts, anciens enregistrements Google Meet mis en ligne via un lien public, ainsi que clips TikTok ou Instagram. Même des podcasts dans lesquels le fondateur n'apparaît que dix minutes ajoutent des données utiles, car les modèles vocaux s'entraînent sur des heures, pas sur des minutes, et chaque heure supplémentaire augmente la fidélité.
Il en résulte que tout fondateur exposé publiquement depuis deux ans ou plus a, en pratique, déjà dépassé le seuil de données nécessaire pour un clone correct. Le coût marginal pour passer de correct à excellent se résume surtout au calcul et au temps.
Pipeline de clonage vocal
Avec environ trente secondes de parole claire, la synthèse vocale moderne peut produire un clone reconnaissable. Avec trois à cinq heures de parole claire, le clone devient interactif, c'est-à-dire capable de répondre à des sollicitations en direct avec une faible latence. Des projets open source dans l'espace de la synthèse vocale ouverte, plus un seul GPU grand public, suffisent pour affiner un modèle qui tient la route lors d'un appel téléphonique normal.
La latence interactive compte, car lors d'une attaque en direct la victime posera des questions imprévues. Un extrait préenregistré s'effondre dès que la victime sort du script. Un modèle vocal interactif, non.
Deepfake vidéo en temps réel lors d'appels en direct
Pour la vidéo en direct, les attaquants utilisent des pipelines de réanimation faciale qui pilotent le visage d'une cible à partir des expressions d'un autre acteur en temps réel. L'attaquant pilote la marionnette depuis sa propre webcam. L'écran de la victime voit le visage cloné parler avec la voix clonée, avec une synchronisation labiale suffisamment bonne sur la caméra d'un ordinateur portable dans des conditions d'éclairage normales.
Autrefois, cet outillage exigeait une station de travail puissante. Il fonctionne désormais sur un ordinateur portable gaming de milieu de gamme. Les points faibles restants sont un éclairage qui ne correspond pas à celui du locuteur d'origine, des artefacts occasionnels autour de la bouche, ainsi que des lunettes ou accessoires sur lesquels le modèle n'a pas été entraîné. Les attaquants contournent l'essentiel de ces problèmes en choisissant des séquences avec un éclairage cohérent et sans accessoires.
Par-dessus, l'ingénierie sociale
Rien de tout cela ne fonctionne sans script. Le volet technique impressionne, mais ce qui fait aboutir l'arnaque, c'est l'ingénierie sociale. L'attaquant choisit une cible, étudie ses publications publiques et sélectionne un prétexte plausible. Le faux fondateur doit avoir une raison de contacter cette personne, à ce moment-là, à propos de ce sujet. Parmi les prétextes courants figurent une allocation anticipée pour un projet stealth, une proposition de trésorerie nécessitant une signature, une divulgation urgente liée à la sécurité ou une faveur personnelle.
Le prétexte est la partie que l'IA ne peut pas faire à la place de l'attaquant. C'est aussi la partie la plus contrôlable du côté de la défense, parce que c'est exactement là que s'applique la règle du canal secondaire.
Où vous rencontrez ces attaques dans la nature
Les canaux de diffusion comptent, car chacun présente des caractéristiques de détection différentes et des réponses de plateforme différentes.
Appels Zoom, Google Meet et Telegram
Les appels vidéo chiffrés de bout en bout sont le cas le plus difficile à surveiller pour les plateformes, car la plateforme ne voit jamais les pixels comme le ferait un observateur extérieur. Un Zoom en tête-à-tête entre deux participants consentants est essentiellement opaque pour Zoom lui-même. La défense repose entièrement sur l'humain présent dans l'appel.
Audio X Spaces et Twitter Spaces
Les Spaces audio uniquement sont devenus un terrain de chasse. Les Spaces sont en direct, le plus souvent non modérés, et faciles à usurper avec un clone vocal puisqu'il n'y a pas de vidéo à comparer. Les escrocs rejoignent des Spaces légitimes comme co-animateurs en utilisant une voix clonée, publient un lien malveillant dans un tweet épinglé ou dans la description du Space, puis s'en vont. Le Space se termine et le lien épinglé continue d'apparaître haut dans les recherches.
Livestreams YouTube et X
Les faux cadeaux en livestream sont la variante la plus répandue. Les attaquants achètent soit une chaîne qui diffusait auparavant un événement légitime avec un fondateur, soit ils assemblent et rediffusent des séquences volées avec une nouvelle surcouche graphique. Le commentaire épinglé et le QR code affiché à l'écran pointent tous deux vers le wallet de l'escroc. La détection par YouTube et X est réactive, ce qui signifie que les streams ne sont retirés qu'après signalement par les spectateurs. La première heure d'un stream est donc celle où le plus de victimes cliquent.
Messages directs sur X et Telegram
Les DM sont le point d'entrée. Presque toutes les arnaques par appel en direct commencent par un DM qui imite le compte d'un fondateur, parfois via une subtile modification du handle, parfois via la prise de contrôle d'un vrai compte, parfois via une promotion payante d'un faux compte. À partir de là, l'attaquant pousse la cible vers un canal privé où le deepfake devient déterminant.
Ce que les plateformes détectent et ce qu'elles ne détectent pas
Il vaut la peine d'être précis au sujet des défenses des plateformes, car les surestimer constitue en soi un risque.
Détection par la plateforme
YouTube et X analysent les contenus mis en ligne et en direct à la recherche d'artefacts de deepfake connus, en combinant hachage et détecteurs fondés sur des modèles. Ils retirent aussi rapidement les comptes d'usurpation signalés. Leur faiblesse, c'est la latence. Un livestream lancé à midi peut collecter des fonds importants avant qu'un examinateur humain ne le retire à 12 h 40.
Zoom et Google Meet n'exécutent pas de détection de deepfake sur les appels privés. Ils s'appuient sur les signalements des participants et sur l'analyse forensique après incident. Les appels chiffrés de pair à pair ne donnent tout simplement pas à la plateforme l'occasion d'intervenir.
La vérification de compte ne vous sauve pas
Une coche bleue, ou n'importe quel badge de vérification de plateforme, ne garantit pas que la personne derrière le compte est bien celle qu'elle prétend être. La vérification vous indique que le compte a, à un moment donné, été jugé notable. Elle ne prouve pas que l'humain au clavier est l'humain sur la photo. Les prises de contrôle de vrais comptes vérifiés se produisent régulièrement. En pratique, la vérification payante sur X a rendu l'usurpation plus facile, pas plus difficile.
Le watermarking IA n'est pas encore une défense fiable
Plusieurs fournisseurs de modèles intègrent des filigranes invisibles à leurs contenus générés. Les filigranes sont utiles pour faire respecter les retraits après coup, mais ils ne vous protègent pas pendant une attaque en direct. Un attaquant motivé peut supprimer un filigrane, utiliser un modèle open source qui n'en intègre pas, ou simplement exécuter le modèle en local. Considérez les filigranes comme un outil d'analyse forensique pour les plateformes, pas comme un bouclier pour les utilisateurs.
La règle de vérification par canal secondaire
Voici l'habitude qui neutralise toute cette catégorie d'attaque. Elle est procédurale, elle vous coûte environ soixante secondes par demande, et elle fonctionne quelle que soit la qualité atteinte par le deepfake.
La règle
Si quelqu'un vous contacte sur un canal, que ce soit par DM sur X, Telegram, Zoom, email ou téléphone, et vous demande de faire quelque chose qui déplace de l'argent ou signe une transaction, considérez par défaut que ce canal est compromis. N'agissez pas sur la demande dans ce canal. Raccrochez, quittez le chat ou arrêtez l'appel. Ensuite, prenez vous-même contact via un deuxième canal auquel vous faites déjà confiance, en utilisant une méthode de contact que vous aviez déjà avant l'arrivée de la demande.
Si un fondateur vous envoie un DM sur X pour vous demander de signer une proposition de trésorerie, vous quittez le DM et envoyez un email à l'adresse professionnelle connue du fondateur, ou vous appelez son numéro de téléphone connu, ou vous envoyez un message à son handle Telegram vérifié depuis votre liste de contacts existante. Si un soi-disant investisseur principal vous appelle sur Telegram, vous raccrochez et appelez le numéro figurant sur le site web de son entreprise.
Si vous ne pouvez pas joindre cette personne indépendamment sur un deuxième canal, la demande échoue. C'est toute la règle.
Pourquoi cela fonctionne même contre des deepfakes parfaits
L'attaquant peut cloner un visage, une voix et un style d'écriture. Il ne peut pas être présent en même temps sur deux canaux sans lien entre eux, en se faisant passer pour la même personne, sans avoir préparé les deux côtés à l'avance. Si vous exigez toujours un contact via un canal que l'attaquant n'a pas initié, l'attaquant est forcé de compromettre ce deuxième canal aussi. C'est un problème bien plus difficile, et cela implique généralement soit de voler votre liste de contacts, soit de compromettre un appareil, deux choses qui sont détectables séparément.
Ce que cela vous coûte
Cela vous coûte une étape supplémentaire par demande sensible. Pour les demandes routinières, un DM d'un collègue disant bonjour, cela va. Pour tout ce qui implique une signature de wallet, un virement, un mouvement de trésorerie, une allocation anticipée ou une seed phrase, cette étape supplémentaire est le prix d'entrée. La plupart des personnes qui se font piéger par des arnaques au deepfake ont sauté cette étape parce que la demande paraissait urgente.
Des habitudes pratiques qui s’ajoutent à la règle
La règle hors bande est l’habitude fondamentale. Quelques habitudes plus petites facilitent son application constante.
Conservez une liste de contacts privée
Gardez une petite liste hors ligne de méthodes de contact vérifiées pour les personnes qui peuvent vous demander de déplacer des fonds ou de signer des transactions. Cela peut être une entrée dans un gestionnaire de mots de passe, une note chiffrée ou un carnet papier. L’idée est que vous ne récupériez jamais les coordonnées d’un fondateur à partir du DM qu’il vous a envoyé. Vous les prenez dans vos propres archives.
Utilisez des hardware wallets et une signature explicite
Du côté du wallet, utilisez un hardware wallet et considérez chaque signature comme une transaction que vous comptez autoriser. Lisez le message en langage clair sur l’écran de l’appareil. Définissez des limites d’autorisation. Un drainer ne peut pas déplacer plus que l’autorisation que vous avez accordée. Traitez les autorisations illimitées comme vous traiteriez un inconnu qui vous demanderait les clés de votre maison.
Fixez-vous un délai personnel pour les actions à forte valeur
La plupart des arnaques par deepfake reposent sur l’urgence. L’appelant dit que le mouvement de trésorerie doit se faire maintenant, que le lancement est dans une heure, que la divulgation de sécurité est sensible au temps. Adoptez une règle personnelle selon laquelle tout ce qui dépasse un petit seuil ne peut pas se faire dans l’heure même où cela a été demandé. L’urgence est une caractéristique de l’attaque, pas une propriété de la tâche légitime.
Expliquez-le ouvertement à votre équipe
Si vous dirigez un projet, écrivez publiquement ce que vos fondateurs feront et ne feront pas. Vitalik Buterin vous enverra-t-il un jour un DM pour un giveaway ? Non. Le PDG d’un grand exchange vous appellera-t-il sur Telegram pour organiser une transaction OTC personnelle ? Non. Publiez ces règles afin que votre équipe ait quelque chose de concret à montrer au lieu de se fier à une simple impression.
Gardez une longueur d’avance sur les tentatives d’usurpation par IA
Les arnaques crypto par deepfake alimentées par l’IA évoluent rapidement, car les modèles sous-jacents évoluent rapidement, et parce que la présence publique des fondateurs crypto offre aux attaquants un ensemble d’entraînement pratiquement illimité. La vigilance manuelle sur un seul canal est une bataille perdue, car au moment où vous avez appris à repérer un indice, la version suivante du modèle l’a déjà supprimé. Zippfeed suit en temps réel l’actualité de la sécurité et la couverture des schémas d’arnaque dans la crypto, avec un score de sentiment et une note d’importance pour chaque titre, afin que vous puissiez voir quelles techniques d’usurpation circulent cette semaine avant qu’elles n’atteignent vos DM.