A carregar preços…

Burlas cripto com deepfakes de IA: como funcionam e como se proteger

Burlões usam vídeo de IA e clones de voz de fundadores cripto em chamadas ao vivo. Veja como funciona o ataque e o hábito que o trava.

Burlas cripto com deepfakes de IA: como funcionam e como se proteger

O que é realmente um esquema cripto com deepfake de AI

Um esquema cripto com deepfake de AI é uma fraude que usa um clone de AI generativa de uma pessoa real, normalmente um fundador, executivo ou influenciador, para convencer uma vítima a enviar criptomoeda, aprovar uma assinatura maliciosa de carteira ou entregar uma seed phrase. O clone pode ser vídeo, voz em áudio ou ambos, e é cada vez mais apresentado em tempo real durante uma conversa ao vivo, em vez de ser um clipe pré-gravado.

Esta categoria existe em teoria há anos, mas passou de demonstrações de investigação para ataques reais em 2024 e 2025. Duas coisas mudaram ao mesmo tempo. Primeiro, os modelos open-source de reencenação facial e síntese de voz tornaram-se baratos e bons. Segundo, o crypto Twitter, os X Spaces, as livestreams do YouTube e as chamadas AMA de projetos deixaram enormes arquivos públicos de fundadores a falar. Essas imagens são os dados de treino.

O objetivo deste artigo não é assustá-lo com deepfakes em geral. É explicar o fluxo real do ataque que vítimas reais descreveram, mostrar que sinais são fáceis de falsificar e quais não são, e depois ensinar um hábito processual que torna toda esta categoria ineficaz contra si. Se se lembrar apenas de uma coisa, lembre-se da regra da verificação por canal alternativo no fim.

Os riscos reais: o que as vítimas perdem de facto

Antes da mecânica, ajuda ver o que corre mal quando as pessoas são enganadas. O padrão é consistente porque o ataque é construído em torno de urgência, autoridade e uma única ação irreversível.

Chamadas individuais em direto

A versão mais cara é a chamada individual em direto. Um alvo, muitas vezes um colaborador inicial de um projeto mais pequeno, recebe uma mensagem direta de alguém que afirma ser um fundador importante e oferece mentoria ou um negócio. Passam para uma chamada Zoom ou Telegram. O vídeo e a voz da outra parte são um deepfake. A conversa é conduzida para uma assinatura de carteira que parece uma aprovação padrão, mas que na verdade é uma drenagem de autorização de tokens. O alvo assina. Os fundos desaparecem em minutos, e reversões on-chain quase nunca são possíveis.

Falsos brindes em livestream

A versão para o grande público é uma livestream falsa. Os burlões sequestram um canal real do YouTube, compram uma conta do X com aparência verificada ou retransmitem uma gravação roubada de um fundador real. O fundador aparece no ecrã a dizer que qualquer pessoa que envie BTC ou ETH para um endereço de carteira receberá o dobro de volta. O endereço é controlado pelo burlão. Relatórios da Chainalysis e de investigadores on-chain mostraram repetidamente que estas operações podem arrecadar valores de cinco a sete dígitos numa única transmissão de várias horas.

Ataques apenas por voz contra equipas

A clonagem de voz tem sido usada para ligar a funcionários de projetos cripto, sobretudo em funções financeiras e operacionais, fazendo-se passar por um fundador ou por um investidor principal. Quem liga pede uma transferência urgente, uma movimentação de tesouraria ou um desbloqueio antecipado de tokens. Como a voz parece certa e o pedido encaixa num fluxo de trabalho interno plausível, o funcionário age. Estes casos foram comunicados em pelo menos duas empresas cotadas em bolsa adjacentes ao setor cripto, com perdas de milhões por incidente.

O fio condutor nos três casos é que o problema técnico de deteção é difícil e está a tornar-se mais difícil. A defesa processual é a mesma e está a tornar-se mais fácil. Voltaremos a isso.

Como os burlões constroem uma imitação convincente

O processo técnico para uma burla de deepfake individual é mais acessível do que a maioria das pessoas imagina. Não é preciso um actor estatal. É preciso paciência, algumas ferramentas open-source e um alvo que tenha falado publicamente durante alguns anos.

Obtenção do material de treino

O primeiro passo é recolher o áudio e o vídeo públicos do alvo. A lista de fontes é longa e bem conhecida dos atacantes. Áudio de X Spaces e Twitter Spaces, entrevistas e AMAs no YouTube, palestras de conferências no YouTube e no Rumble, participações em podcasts, gravações antigas do Google Meet que foram carregadas para uma ligação pública, e clips do TikTok ou do Instagram. Mesmo podcasts em que o fundador só aparece durante dez minutos acrescentam dados úteis, porque os modelos de voz são treinados com horas, não com minutos, e cada hora adicional aumenta a fidelidade.

O resultado é que qualquer fundador que tenha tido presença pública durante dois ou mais anos, na prática, já está acima do limiar de dados necessário para um clone razoável. O custo marginal de passar de razoável a excelente é sobretudo capacidade de computação e tempo.

Pipeline de clonagem de voz

Com cerca de trinta segundos de fala limpa, a síntese de voz moderna consegue produzir um clone reconhecível. Com três a cinco horas de fala limpa, o clone torna-se interactivo, o que significa que consegue responder a instruções em directo com baixa latência. Projectos open-source na área da síntese de fala aberta, juntamente com uma única GPU de consumo, são suficientes para afinar um modelo que aguenta uma chamada telefónica normal.

A latência interactiva é importante porque, num ataque em directo, a vítima fará perguntas inesperadas. Um clip pré-gravado deixa de funcionar no momento em que a vítima sai do guião. Um modelo de voz interactivo não.

Deepfake de vídeo em tempo real em chamadas ao vivo

Para vídeo em directo, os atacantes usam pipelines de reencenação facial que animam o rosto de um alvo a partir das expressões de outro actor em tempo real. O atacante controla a marioneta a partir da sua própria webcam. No ecrã da vítima, vê-se o rosto clonado a falar com a voz clonada, com uma sincronização labial suficientemente boa numa câmara de portátil com iluminação normal.

Estas ferramentas costumavam exigir uma estação de trabalho potente. Agora funcionam num portátil gaming de gama média. Os pontos fracos restantes são iluminação que não corresponde à do orador original, artefactos ocasionais na boca, e óculos ou acessórios em que o modelo não foi treinado. Os atacantes contornam a maior parte destes problemas escolhendo imagens com iluminação consistente e sem acessórios.

Engenharia social por cima

Nada disto funciona sem um guião. A parte técnica impressiona as pessoas, mas o que concretiza a burla é a engenharia social. O atacante escolhe um alvo, estuda as suas publicações públicas e escolhe um pretexto plausível. O falso fundador precisa de uma razão para contactar esta pessoa, neste momento, sobre este assunto. Pretextos comuns incluem uma alocação antecipada para um projecto stealth, uma proposta de tesouraria que precisa de uma assinatura, uma divulgação urgente de segurança, ou um favor pessoal.

O pretexto é a parte que a AI não consegue fazer pelo atacante. É também a parte que é mais controlável do lado do defensor, porque é exactamente aí que se aplica a regra de verificação por outro canal.

Onde encontra estes ataques na prática

Os canais de entrega são importantes, porque cada um tem propriedades de detecção diferentes e respostas diferentes por parte das plataformas.

Chamadas no Zoom, Google Meet e Telegram

As videochamadas encriptadas de ponta a ponta são o caso mais difícil para as plataformas policiarem, porque a plataforma nunca vê os píxeis da forma como um observador externo veria. Uma chamada individual no Zoom entre dois participantes que consentem é essencialmente opaca para o próprio Zoom. A defesa recai totalmente sobre a pessoa na chamada.

Áudio em X Spaces e Twitter Spaces

Os Spaces apenas com áudio tornaram-se um terreno de caça. Os Spaces são em directo, maioritariamente sem moderação, e fáceis de falsificar com um clone de voz porque não há vídeo para comparar. Os burlões entram em Spaces legítimos como coanfitriões usando uma voz clonada, deixam uma ligação maliciosa como tweet fixado ou na descrição do Space, e saem. O Space termina e a ligação fixada continua a aparecer bem posicionada na pesquisa.

Directos no YouTube e no X

Os sorteios em directos são a variante de maior volume. Os atacantes compram um canal que transmitiu anteriormente um evento legítimo de um fundador, ou juntam e retransmitem imagens roubadas com uma nova sobreposição gráfica. O comentário fixado e o código QR no ecrã apontam ambos para a carteira do burlão. A detecção pelo YouTube e pelo X é reactiva, o que significa que as transmissões só são removidas depois de os espectadores as denunciarem, por isso a primeira hora de uma transmissão é quando a maioria das vítimas clica.

Mensagens directas no X e no Telegram

As DMs são o ponto de entrada. Quase todas as burlas com chamada ao vivo começam com uma DM que imita a conta de um fundador, por vezes através de uma troca subtil no identificador, por vezes através da tomada de controlo de uma conta real, por vezes através de uma promoção paga de uma conta falsa. A partir daí, o atacante empurra o alvo para um canal privado onde o deepfake passa a ser relevante.

O que as plataformas detectam e o que não detectam

Vale a pena ser específico sobre as defesas das plataformas, porque sobrestimá-las é, por si só, um risco.

Detecção pela plataforma

O YouTube e o X analisam conteúdos carregados e em directo em busca de artefactos conhecidos de deepfake, usando uma combinação de hashing e detectores baseados em modelos. Também removem rapidamente contas de imitadores denunciadas. A sua fraqueza é a latência. Um directo que começa ao meio-dia pode recolher fundos significativos antes de um revisor humano o remover às 12:40.

O Zoom e o Google Meet não executam detecção de deepfake em chamadas privadas. Dependem de denúncias dos participantes e de análise forense após o incidente. Chamadas encriptadas peer-to-peer simplesmente não dão à plataforma oportunidade de intervir.

A verificação da conta não o salva

Um visto azul, ou qualquer emblema de verificação de uma plataforma, não é garantia de que a pessoa por trás da conta é quem afirma ser. A verificação diz-lhe que a conta já foi considerada relevante. Não prova que o humano ao teclado é o humano na fotografia. Tomadas de controlo de contas reais verificadas acontecem regularmente. A verificação paga no X, na prática, tornou a imitação mais fácil, não mais difícil.

A marca de água de AI ainda não é uma defesa fiável

Vários fornecedores de modelos incorporam marcas de água invisíveis nos resultados gerados. As marcas de água são úteis para aplicar remoções depois do facto, mas não o protegem durante um ataque em directo. Um atacante motivado pode remover uma marca de água, usar um modelo open-source que não incorpore nenhuma, ou simplesmente executar o modelo localmente. Encare as marcas de água como uma ferramenta forense para plataformas, não como um escudo para utilizadores.

A regra de verificação por outro canal

Eis o hábito que neutraliza toda esta categoria de ataque. É procedimental, custa-lhe cerca de sessenta segundos por pedido, e funciona independentemente de quão bom o deepfake se torne.

A regra

Se alguém o contactar num canal, seja X DM, Telegram, Zoom, email ou telefone, e lhe pedir para fazer algo que mova dinheiro ou assine uma transacção, trate esse canal como comprometido por defeito. Não actue sobre o pedido nesse canal. Desligue, saia da conversa, ou pare a chamada. Depois, inicie contacto através de um segundo canal em que já confia, usando um método de contacto que já tinha antes de o pedido chegar.

Se um fundador lhe enviar uma DM no X a pedir que assine uma proposta de tesouraria, fecha a DM e envia um email para o endereço profissional conhecido do fundador, ou liga para o número de telefone conhecido, ou envia uma mensagem para o identificador verificado no Telegram a partir da sua lista de contactos existente. Se um suposto investidor principal lhe ligar pelo Telegram, desliga e telefona para o número indicado no site da empresa dele.

Se não conseguir contactar a pessoa de forma independente num segundo canal, o pedido falha. Essa é a regra completa.

Porque funciona mesmo contra deepfakes perfeitos

O atacante consegue clonar um rosto, uma voz e um estilo de escrita. Não consegue estar em dois canais não relacionados ao mesmo tempo, fingindo ser a mesma pessoa, sem preparar previamente ambos os lados. Se exigir sempre contacto através de um canal que o atacante não iniciou, o atacante é obrigado a comprometer também esse segundo canal. Esse é um problema muito mais difícil, e normalmente envolve roubar a sua lista de contactos ou comprometer um dispositivo, ambos detectáveis separadamente.

O que isto lhe custa

Custa-lhe um passo adicional por pedido sensível. Para pedidos rotineiros, uma DM de um colega a dizer olá, isto é aceitável. Para qualquer coisa que envolva uma assinatura de carteira, uma transferência bancária, uma movimentação de tesouraria, uma alocação antecipada, ou uma seed phrase, o passo adicional é o preço de entrada. A maioria das pessoas que é apanhada por burlas de deepfake saltou este passo porque o pedido parecia urgente.

Hábitos práticos que se somam à regra

A regra do canal fora de banda é o hábito fundamental. Alguns hábitos mais pequenos facilitam a sua aplicação consistente.

Mantenha uma lista privada de contactos

Mantenha uma pequena lista offline de métodos de contacto verificados para pessoas que o possam pedir para transferir dinheiro ou assinar transações. Isto pode ser uma entrada num gestor de palavras-passe, uma nota encriptada ou um caderno em papel. O objetivo é que nunca obtenha o contacto de um fundador a partir do DM que ele lhe enviou. Obtém-no a partir do seu próprio registo.

Use carteiras de hardware e assinaturas explícitas

No lado da carteira, use uma carteira de hardware e trate cada assinatura como uma transação que pretende autorizar. Leia a mensagem legível para humanos no ecrã do dispositivo. Defina limites de autorização. Um drainer não pode mover mais do que a autorização que concedeu. Trate autorizações ilimitadas da mesma forma que trataria um desconhecido que lhe pede as chaves de casa.

Defina um atraso pessoal para ações de alto valor

A maioria das fraudes com deepfakes depende da urgência. A pessoa que liga diz que a movimentação da tesouraria tem de acontecer já, que o lançamento é daqui a uma hora, que a divulgação de segurança é sensível ao tempo. Crie uma regra pessoal segundo a qual tudo o que esteja acima de um pequeno limiar não pode acontecer na mesma hora em que foi pedido. A urgência é uma característica do ataque, não uma propriedade da tarefa legítima.

Informe a sua equipa de forma aberta

Se gere um projeto, escreva em público o que os seus fundadores farão e não farão. O Vitalik Buterin alguma vez lhe enviará uma DM sobre um giveaway? Não. O CEO de uma grande bolsa ligará no Telegram para organizar uma negociação OTC pessoal? Não. Publique estas normas para que a sua equipa tenha algo a apontar, em vez de se guiar por intuições.

Fique à frente das tentativas de personificação por IA

As fraudes cripto com deepfakes de IA estão a evoluir rapidamente porque os modelos subjacentes estão a evoluir rapidamente, e porque a presença pública dos fundadores de cripto dá aos atacantes um conjunto de treino praticamente ilimitado. A vigilância manual num único canal é uma aposta perdida, pois, quando já aprendeu a detetar um sinal, a versão seguinte do modelo já o eliminou. A Zippfeed acompanha notícias de segurança e cobertura de padrões de fraude em tempo real em todo o ecossistema cripto, com pontuação de sentimento e uma classificação de importância em cada manchete, para que possa ver quais as táticas de personificação que estão a circular esta semana antes de chegarem às suas DMs.

Perguntas frequentes

É seguro entrar num Space do X ou numa transmissão em direto de um fundador cripto em 2026?
Os Spaces com áudio em direto e as transmissões em direto no YouTube são um vetor conhecido para clonagem de voz e burlas de falsos sorteios, e a moderação das plataformas é mais reativa do que preventiva. Trate qualquer oferta do tipo enviar fundos e receber mais em troca como fraudulenta por defeito, e nunca ligue uma carteira a um site promovido no comentário fixado de uma transmissão em direto. Se quiser verificar um evento, procure de forma independente os canais oficiais do fundador e confirme se a transmissão foi anunciada aí.
Como funcionam, na prática, as burlas cripto com deepfakes de IA em tempo real?
Os atacantes recolhem áudio e vídeo públicos de um fundador real, ajustam um modelo de voz e um modelo de reencenação facial com esse material, e depois usam ambos durante uma chamada individual em direto no Zoom, Telegram ou numa plataforma semelhante. O deepfake aguenta-se suficientemente bem numa câmara normal de portátil para a vítima seguir instruções para assinar uma aprovação de carteira, enviar cripto ou partilhar credenciais. A parte técnica é barata e está a ficar ainda mais barata, por isso a defesa tem de ser processual e não visual.
Devo confiar numa videochamada de alguém que diz ser um fundador cripto conhecido?
Não deve agir com base apenas nessa chamada, por mais convincente que o vídeo pareça. Desligue e contacte depois o fundador através de um segundo canal em que já confiava antes de a chamada chegar, como um endereço de email conhecido, um número de telefone do site oficial ou uma conta que já tenha usado anteriormente. Se não conseguir contactá-lo de forma independente, trate o pedido como um ataque. Esta é a regra de verificação fora do canal, e funciona contra todos os tipos de deepfake, incluindo os tecnicamente perfeitos.
A marca de água de IA ou as ferramentas de deteção podem proteger-me de burlas com deepfakes?
Não de forma fiável durante um ataque ao vivo. As marcas de água ajudam as plataformas a remover conteúdo depois do facto, mas um atacante motivado pode retirar a marca, usar um modelo open-source que não a incorpore ou gerar tudo localmente. Existem ferramentas de deteção de deepfakes em tempo real, mas produzem falsos positivos e falsos negativos, e não correm dentro da sua chamada no Zoom. A defesa que realmente resiste é processual, por isso a regra fora do canal é mais importante do que qualquer produto de deteção que possa instalar.
Tokens relacionados
$BTC $ETH