Um funcionário do setor financeiro em Hong Kong desconfiou que o e-mail era golpe. Então fez o que cinco séculos de bons conselhos mandam fazer: verificou. Entrou numa videochamada e olhou os colegas nos olhos. Os rostos estavam certos. As vozes estavam certas. Quinze transferências depois, vinte e cinco milhões e meio de dólares tinham sumido, e todo mundo naquela chamada, menos ele, era sintético.
O áudio do episódio é em inglês. Ouça no YouTube ou em qualquer app de podcast. A seguir, a transcrição completa traduzida para o português, em capítulos.
Abertura 0:00
O Podcast de Pistomecânica. Esse não é o programa que você estava esperando. Essa é a programação que já roda dentro de você. Juntos, a gente construiu essa civilização desajeitada, crença por crença. Agora a gente toma as rédeas, trabalhando com a máquina sublime que ninguém te ensinou a pilotar: a sua própria mente. Bem-vindo ao Podcast de Pistomecânica. Nunca foi tão fácil mentir. Uma voz, um rosto, uma foto: hoje qualquer pessoa consegue fabricar qualquer uma dessas coisas. E, como todo mundo sabe disso, está acontecendo uma coisa mais estranha. Até a verdade passa a ser posta em dúvida. Então, como é que a gente se protege? E não estou falando do governo protegendo a gente. Estou falando da gente se protegendo.
Bem-vindo ao episódio quatro do Podcast de Pistomecânica. Hoje a gente vai passar por uma pilha de registros históricos, análises de cibersegurança e estudos sobre mídia para tentar responder a uma pergunta central. Isso, a gente quer entender como a civilização constrói crenças quando as nossas defesas mais antigas contra o engano simplesmente param de funcionar. Certo. Mais especificamente, a gente vai ver o que acontece quando o próprio ato de checar as evidências, sabe, fazer a lição de casa, vira a própria armadilha.
Vai, sim. Porque as ferramentas em que você confia todo dia para se orientar na realidade estão mudando de um jeito profundo.
Um homem que fez tudo certo 1:42
E, para ver como essa mudança funciona na prática, a gente precisa começar em janeiro de 2024, com um funcionário do setor financeiro do escritório da Arup em Hong Kong. Certo, a Arup é aquela grande empresa britânica de engenharia, não é? Ela mesma. Foi a empresa que trabalhou na Ópera de Sydney e no Estádio Ninho de Pássaro, em Pequim. Uma empresa super consolidada. Pois bem, esse funcionário recebeu um e-mail que parecia vir do diretor financeiro da empresa, em Londres. A mensagem falava de uma transação confidencial e, basicamente, pedia que ele cuidasse daquilo com discrição.
Deixa eu te interromper aqui um segundo, porque, se você está ouvindo isso no caminho para o trabalho ou no próprio trabalho, provavelmente é uma pessoa ocupada, tentando tomar boas decisões o dia inteiro, e é muito fácil ouvir o começo dessa história e já achar que quem recebeu o e-mail foi descuidado. É, as pessoas costumam tirar essa conclusão. Mas ele não foi nada descuidado. O instinto dele funcionou perfeitamente. Ele leu o e-mail e na hora desconfiou de phishing, que é exatamente a reação racional certa diante de uma mensagem inesperada pedindo dinheiro. Ele fez exatamente o que cinco séculos de alfabetização, e provavelmente uma dúzia de treinamentos corporativos de segurança, ensinaram. Ele verificou. Verificou, sim.
Ele não quis de jeito nenhum agir só com base no e-mail. Em vez disso, entrou numa videoconferência para confirmar o pedido. Certo. Foi atrás de uma prova. Exato. E, nessa videochamada, ele viu o diretor financeiro. Viu também vários outros colegas que ele conhecia da empresa. Ali na tela, com ele? Isso. Os rostos eram os das pessoas que ele conhecia, as vozes também, e eles discutiram a transação confidencial com ele em tempo real, na tela. E, como a checagem tinha passado, as dúvidas dele sumiram.
E claro que sumiram. Ele confiou nos próprios olhos e ouvidos. Checou as evidências, e as evidências disseram que o pedido era real. Isso instalou uma crença completamente falsa. Certo. Então, seguindo as instruções que recebeu naquela videochamada, ele começou a movimentar o dinheiro. Ao longo da noite, fez 15 transferências separadas para cinco contas bancárias diferentes em Hong Kong. Quinze transferências? Isso. No total, foram 200 milhões de dólares de Hong Kong. Dá mais ou menos 25,5 milhões de dólares americanos.
Nossa. A fraude só apareceu depois, quando ele finalmente entrou em contato com a sede da Arup em Londres. E imagino que Londres não fazia ideia do que ele estava falando? Nenhuma. A sede não tinha autorizado transação nenhuma. Não tinha feito reunião nenhuma. Não sabia de videochamada nenhuma. Depois, a polícia de Hong Kong concluiu que todos os participantes daquela videochamada, fora a própria vítima, eram sintéticos. Todos, sem exceção. Quero ter certeza de que quem está ouvindo entendeu mesmo a mecânica disso. 15 transferências. 25,5 milhões de dólares. Todo mundo na tela, menos o homem que movimentava o dinheiro, era pura fabricação.
Eles foram gerados a partir de vídeos e áudios públicos daqueles executivos específicos. Os atacantes usaram teleconferências de resultados, painéis de congresso. Usaram simplesmente a matéria-prima comum que está em domínio público para quase todo alto executivo do mundo hoje. O peso disso é difícil de digerir. Pensa no que é estar no lugar daquele funcionário. É um homem que foi derrubado justamente pela verificação. Em nenhum momento daquela noite a pergunta que ele se fazia, “isso é real?”, ajudou. Porque, por uns 500 anos, a civilização teve dois remédios contra o engano. E eles funcionavam: olhar mais de perto e reunir mais fontes. O que acontece com uma civilização quando esses dois movimentos viram o próprio caminho por onde o golpe chega?
Cinco séculos olhando mais de perto 5:08
Bom, para responder a isso, a gente precisa ver de onde vieram, afinal, esses dois remédios antigos. Certo, vamos à história. Porque a instrução de olhar mais de perto ou de reunir mais fontes não foi uma reação ingênua. Esses movimentos foram respostas imunológicas, construídas de propósito. Quando a prensa de tipos móveis chegou à Europa, ela não trouxe só a difusão do conhecimento. Trouxe também uma enxurrada de falsificações, panfletos inventados, calúnias impressas. E a resposta a essa enxurrada, que foi se formando devagar ao longo de gerações, foi um sistema imunológico.
Certo. A sociedade se adaptou. Exato. A gente criou as marcas de impressor para rastrear a origem. Criou o hábito de cruzar referências. Foi crescendo a expectativa de que uma afirmação podia ser conferida com outro exemplar impresso ou com outra edição para se chegar à verdade. Ou seja, a gente montou sistemas para lidar com a tecnologia nova. E a gente viu esse mesmo padrão se repetir depois, não é? Quando a tecnologia mudou de novo. Viu. No fim do século 19, a imprensa marrom transformou a guerra de circulação dos jornais numa verdadeira guerra de invenção. Os editores publicavam qualquer coisa que vendesse jornal. A resposta construída para esse ambiente foi a criação de normas profissionais no jornalismo.
Como checar fatos e citar fontes. Isso. Surgiu a exigência de fontes, a publicação de correções, a separação rígida entre notícia e opinião. E a premissa por trás de todas essas adaptações era que o engano se desmascara com mais informação. Certo. Um documento forjado é desfeito por um autêntico. O remédio para o discurso ruim era mais discurso. O que quer dizer que a premissa de base, aquela que você e eu herdamos, é que, se alguém lança uma tecnologia nova capaz de enganar as pessoas, o público acaba desenvolvendo um jeito de enxergar a costura. A gente supõe que vai ter um breve período de confusão e que depois a gente vai aprender a olhar mais de perto o tipo de papel, ou vai reunir mais fontes para, digamos, vencer a mentira no voto. A gente supõe que a verdade vai se impor de novo.
Supõe, sim. E dá para ver exatamente como essa expectativa foi posta à prova quando a fotografia chegou. Ah, essa é a história de Boston, não é? É. Na década de 1860, um gravador de Boston chamado William Mumler começou a vender o que ele chamava de fotografias de espíritos. Eram retratos em que um parente já falecido aparecia, meio apagado, no fundo, de pé atrás da pessoa viva que posava. Você precisa imaginar o contexto. A década de 1860 é a época da Guerra Civil Americana. O país inteiro está mergulhado no luto. E de repente aparece um homem com uma tecnologia relativamente nova, a câmera, que as pessoas entendem como uma máquina que captura a realidade com perfeição, e ela parece estar capturando os mortos.
Imagino que ele tenha conquistado uma clientela bem séria. Muito séria. A vontade de acreditar era grande. Mary Todd Lincoln posou para ele. Ganhou uma foto de si mesma com as mãos do falecido presidente pousadas nos ombros. Com o tempo, as autoridades intervieram. Em 1869, o estado de Nova York levou Mumler a julgamento por fraude, o que leva direto à pergunta que qualquer ouvinte faria. Certo. Se chega uma tecnologia nova e as pessoas começam a usá-la para enganar o público, os tribunais com certeza entram em cena para descobrir como identificar uma falsificação: você chama peritos para depor, examina as provas físicas no microscópio e estabelece a verdade objetiva. A acusação tentou fazer exatamente isso. Eles sabiam como esse tipo de foto podia ser feito, com dupla exposição ou com placas de vidro preparadas de antemão. Para mostrar isso ao tribunal, chegaram a chamar P.T. Barnum para depor contra Mumler.
Barnum, o empresário de circo? Ele mesmo. E, para provar o que dizia, Barnum mandou um fotógrafo fabricar uma fotografia de espírito do próprio Barnum, com fantasma e tudo. E apresentou essa foto fabricada como prova. Então o Barnum está no papel de quem desmascara. Ele vai ao tribunal e prova que a tecnologia pode ser manipulada. Mostra o mecanismo exato do truque. Ele provou que dava para fazer. Mas o caso desmoronou justamente nessa diferença. Provar que uma fotografia podia ser falsificada não provava que aquelas placas específicas, as placas do próprio Mumler, eram falsas. O tribunal examinou o vidro. Os peritos examinaram o conteúdo. Mas nenhum perito conseguiu demonstrar fraude a partir do conteúdo das placas. Mumler não foi condenado.
Espera. Ele saiu livre? Saiu. O juiz disse em voz alta, no tribunal, que estava moralmente convencido de que tinha havido engano. Mas absolveu Mumler porque simplesmente não dava para sustentar a acusação com as provas físicas apresentadas. Vamos parar um pouco para digerir essa cena. Você tem um tribunal em 1869. Eles estão lidando com uma tecnologia que mal tem uma geração de idade e já não conseguem usar o próprio conteúdo para provar o que é real. Os peritos estão com os olhos grudados na placa de vidro, tentando achar a costura, e a costura não basta para garantir uma condenação. Então, já naquela época, olhar mais de perto o meio não resolvia a verdade do que o meio mostrava.
Em 1869, quando a tecnologia tinha só uma geração de idade, um tribunal já não conseguia decidir, só pelo conteúdo, o que era real. O que mudou desde então não foi a pergunta. Foi o preço de fazer a pergunta e o número de pessoas que podem pagar esse preço. Certo, mas, se a gente está falando de mídia nova enganando o público, tem um episódio histórico que as pessoas sempre citam. Sempre que se fala de tecnologia sequestrando crenças, alguém traz essa história para provar que o ser humano sempre foi crédulo quando aparece um formato novo.
Um pânico que nunca aconteceu 10:15
É, citam a transmissão de rádio de 30 de outubro de 1938: a dramatização de A Guerra dos Mundos, de Orson Welles. Certo. A produção tinha, em parte, o formato de boletins de notícia urgentes, interrompendo um programa de música normal. E a lenda diz que o país entrou em pânico. Famílias teriam fugido de casa, as estradas teriam ficado congestionadas, e uma população inteira simplesmente não conseguiu distinguir teatro de notícia. Essa é a história. É o que a maioria de nós aprendeu na escola. A gente aprendeu que o público ouviu o tom de autoridade de um locutor de notícias e, como o rádio era relativamente novo e inspirava confiança, as pessoas largaram toda a razão e correram para a rua. A transmissão teria instalado uma crença falsa na hora, e com sucesso.
A pesquisa histórica diz outra coisa. Sério? Sério. Historiadores da mídia, especificamente Jefferson Pooley e Michael Socolow, examinaram os registros e mostraram que o pânico, basicamente, não aconteceu. Certo. Não aconteceu de jeito nenhum. A audiência daquela transmissão era, na verdade, modesta. A imensa maioria de quem ouviu entendeu muito bem que era uma peça. Mais tarde, os pesquisadores que foram atrás dos boatos da época, de mortes por choque ou de hospitais atendendo ouvintes apavorados, não encontraram nenhum caso confirmado.
Eu vou ter que questionar isso, porque contradiz uma memória cultural muito forte. Se o pânico não aconteceu, por que todo mundo sabe que ele aconteceu? De onde vieram os números? Porque eu lembro de ver, em livro didático, estimativas de um milhão de pessoas assustadas. A histeria em massa foi fabricada depois, pelos jornais. Em 1938, a imprensa escrita enfrentava uma ameaça econômica séria. Estava perdendo receita de publicidade para o rádio, que era de graça, ficava na sala de estar e dava as notícias urgentes mais rápido.
Ah, então tinha um motivo. Um motivo financeiro bem claro. Na manhã seguinte à transmissão de Welles, jornais de costa a costa publicaram o pânico como fato. Apresentaram o rádio como um meio novo, perigoso e incontrolável, que tinha aterrorizado o país e em que nem os anunciantes nem o público podiam confiar. Fizeram uma operação em tom de alarme. Usaram a posição consolidada de canal de informação confiável para instalar uma crença sobre o concorrente. Exato. E, dois anos depois, essa narrativa dos jornais foi lavada e virou ciência. Um pesquisador de Princeton chamado Hadley Cantril publicou um estudo sobre a transmissão. Ele juntou cartas, recortes de jornal, uma pesquisa por correio com cerca de mil pessoas e umas 150 entrevistas. Só que ele juntou esses dados muito tempo depois de os jornais já terem ensinado ao país que tinha acontecido um pânico em massa.
Então, quando ele faz as entrevistas, o poço já está envenenado. As pessoas com quem ele conversa já sabem que devem ver aquilo como uma histeria nacional. Já estava, sim. Além disso, tinha uma falha mecânica no método dele. Qual? Cantril contou como tomado pelo pânico qualquer um que dissesse ter ficado assustado, perturbado ou até só empolgado com a transmissão. Pois é: se você usar esse critério, todo bom suspense que já passou na televisão causou pânico em massa. Mas, por causa do vínculo institucional dele, ele continua sendo a única fonte com credencial acadêmica que já afirmou que o pânico foi grande.
Como ele tinha as credenciais, o estudo falho entrou nos livros didáticos. E, como entrou nos livros didáticos, entrou em todas as salas de aula. A gente precisa olhar a linha do tempo dessa correção. Foram 75 anos até a pesquisa histórica finalmente pôr os pingos nos is. 75 anos para a sociedade corrigir um boato sobre uma única transmissão. Essa é a velocidade real em que o sistema imunológico antigo funcionava. O que significa que, toda vez que chega um meio novo, o meio que já está estabelecido anuncia um apocalipse epistêmico. O formato antigo avisa que o formato novo vai destruir a nossa capacidade de saber a verdade. E a gente, que está aqui discutindo a engenharia da crença, precisa tomar muito cuidado para não cair no mesmo padrão.
Certo. A gente está examinando mídia sintética, mas não pode se dar ao luxo de cair no tom de alarme. É exatamente por isso que, neste episódio, a gente se apoia estritamente nos números documentados. Mesmo quando esses números vão contra a narrativa alarmista, a gente precisa manter a cabeça fria. Porque, se você olhar de verdade para a mecânica de 1938, a lição não é sobre a credulidade humana diante de uma tecnologia nova. Quase ninguém foi enganado pela transmissão. A história que enganou as pessoas foi a história sobre a transmissão. Então, se o passado mostra que a gente acaba se adaptando às mídias novas e que o alarme inicial muitas vezes é fabricado, a pergunta de verdade é como a gente está se adaptando agora. Vamos voltar àquele primeiro remédio antigo de que a gente falou: o instinto de simplesmente examinar o vídeo, o áudio ou o documento com os próprios olhos até a falsificação mostrar a costura. O que está acontecendo, na prática, com a estratégia de olhar mais de perto?
Hoje, a literatura científica sobre detecção dá uma resposta empírica bem clara para isso.
A detecção humana no nível do acaso 14:56
Pesquisadores fizeram uma metanálise de 56 estudos diferentes sobre a detecção humana de mídia sintética. Essa análise coloca a taxa média de acerto humano com deepfakes em cerca de 55%. Certo, deixa eu garantir que a gente calibre bem esse número para quem está ouvindo. 55% está acima do acaso, e fazer questão de dizer isso é a nossa marca. A gente não está afirmando que o ser humano é totalmente cego. 55% quer dizer que, em média, as pessoas detectam fakes um pouco melhor do que no cara ou coroa. Isso mesmo. Mas é fundamental entender que 55% é uma média entre mídias de qualidades bem diferentes. Para imagens estáticas de rostos sintéticos, vários estudos colocam o desempenho humano bem no nível do acaso. E, no vídeo, os resultados variam muito conforme a qualidade da geração.
Ou seja, quanto melhor o fake, pior a gente se sai. Exato. Um estudo separou vídeos deepfake por dificuldade. Quando os participantes viam os fáceis, os que tinham defeitos visuais óbvios, acertavam cerca de 71% das vezes. Mas, no conjunto de vídeos mais difíceis, a detecção humana caiu para 25%. 25% está abaixo do acaso. Quer dizer que as pessoas olhavam os melhores fakes, estudavam com atenção e diziam, cheias de confiança, que eram reais. Mas isso deve ser o desempenho de quem não teve treino, não? Se você treinar as pessoas, sentar com elas e ensinar o que procurar, tipo a luz que não bate direito na maçã do rosto, uma textura de pele artificial ou o cabelo que se mistura mal com o fundo, esse treinamento não melhora a taxa de detecção?
A literatura também testa essa hipótese. Num estudo específico com mais de 450 pessoas, os pesquisadores tentaram treinar os participantes. Ensinar os sinais clássicos não mudou nem a precisão nem a confiança. Nada? Nada. E esse resultado se repete em toda a literatura. O achado mais consistente nos estudos de detecção de deepfake é o excesso de confiança. As pessoas acreditam firmemente que conseguem perceber a diferença. Vamos desenvolver essa imagem. Pensa numa luz da certeza no seu cérebro. Quando você olha uma coisa de perto, o cérebro processa os detalhes e a luz da certeza fica verde. Você se sente seguro do seu julgamento. O problema é que acreditar que você consegue distinguir um fake da realidade não tem nada a ver com a sua capacidade real de distinguir. O seu cérebro te dá uma sensação de certeza só porque você examinou a imagem. Ou seja, olhar com mais atenção para um fake perfeito não expõe o fake. Só te dá mais tempo para estudar os detalhes, racionalizar o que está vendo e se convencer de que é autêntico.
Na resolução humana, a costura sumiu. Olhar com mais atenção para um bom fake não desmascara o fake. Só aprofunda a convicção. Se olhar de perto falha e a luz da certeza no nosso cérebro está mentindo para a gente, a pessoa racional parte na hora para o segundo remédio antigo. Ela procura corroboração. Você não confia só no documento que está na sua frente. Você vai atrás de uma segunda testemunha. Reúne mais fontes. O que acontece com a corroboração quando a engenharia da crença ganha escala? Bom, a corroboração funcionou por cinco séculos porque era um bom indicador de que havia algo real. Testemunho independente costumava ser caro. Arrumar uma segunda testemunha ou publicar um segundo jornal exigia dinheiro, logística e tempo de gente.
Certo. Dava trabalho. Dava. Por isso, quando várias fontes concordavam, isso indicava de verdade que uma coisa tinha acontecido no mundo físico. Mas essa regra prática morre no momento em que o testemunho fica de graça. E, para mostrar exatamente o quanto ele ficou de graça, a gente tem duas provas muito bem documentadas, com valores exatos em dólar. Certo, vamos à primeira.
Um dólar, vinte minutos 18:21
A primeira aconteceu em janeiro de 2024, dois dias antes da primária presidencial de New Hampshire. Milhares de eleitores democratas receberam uma ligação automática. A ligação tinha a voz do presidente Joe Biden. Trazia até o bordão conhecido dele, “que monte de bobagem”. E pedia que quem estava ouvindo não votasse na primária que estava chegando, mas guardasse o voto para a eleição geral de novembro. A voz ao telefone era sintética. E a gente não está chutando de onde veio esse áudio. A gente sabe exatamente como ele foi produzido e quanto custou.
Pois é. O áudio foi criado por Paul Carpenter, um mágico de rua de Nova Orleans. Ele foi contratado por 150 dólares, pagos pelo aplicativo Venmo, por um consultor político chamado Steve Kramer. 150 dólares? Isso. Depois, Carpenter mostrou para a NBC News o processo exato que usou. Gerar o áudio levou menos de 20 minutos e custou cerca de 1 dólar de processamento. Deixa isso assentar um pouco. 150 dólares pelo Venmo. 20 minutos de trabalho e 1 dólar de processamento. A Comissão Federal de Comunicações acabou multando Kramer em 6 milhões de dólares pela operação. No julgamento criminal, em que ele foi absolvido das acusações estaduais, Kramer declarou que encomendou a ligação como um alerta público, para mostrar como essa tecnologia tinha ficado fácil. Agora, a gente não afirma nada aqui sobre se a ligação mudou de fato a contagem de votos em New Hampshire. A prova é a própria conta: uma imitação do presidente dos Estados Unidos em pleno mandato, no momento eleitoral exato, foi produzida por um mágico de rua pelo preço de um jantar.
Se o áudio é barato assim, quem está ouvindo pode dizer: tudo bem, não vou confiar num único telefonema. Vou procurar reportagens publicadas. Vou procurar vários sites de notícia contando os mesmos fatos. Qual é a sua segunda prova, sobre reunir mais fontes? Ela tem a ver com a escala das fontes independentes.
Três mil redações fantasmas 20:07
A NewsGuard é uma organização que avalia a confiabilidade de veículos de notícia e acompanha a disseminação de desinformação. Ela começou a monitorar sites que publicam notícias geradas em grande parte por IA, com supervisão humana mínima. Em maio de 2023, identificou 49 sites desse tipo. Certo, 49. Três anos depois, esse número tinha passado de 3.700, em 16 idiomas diferentes. 3.700 sites inteiros produzindo notícia automatizada. E crescendo entre 300 e 500 sites novos por mês. Eles têm nomes comuns, com cara de confiáveis, como jornais regionais ou boletins locais. Com o colapso econômico do jornalismo local de verdade, a NewsGuard observou que um site recém-descoberto que diz cobrir notícias locais já tem mais chance de ser sintético do que de ser real. A fonte que você encontra para confirmar uma história quando pesquisa na internet tem chance de meio a meio de ter sido fabricada.
Então todo o ecossistema de informação está se enchendo de fontes sintéticas, que só existem para confirmar outras fontes sintéticas. É uma sala de espelhos. E um artigo de 2024 publicado na revista Nature mostrou exatamente o que acontece com essa sala de espelhos. Os pesquisadores demonstraram que modelos generativos treinados com o que outros modelos generativos produzem se degradam matematicamente. Os modelos precisam da variação humana para funcionar. Sem ela, eles colapsam numa faixa estreita de texto provável. O ecossistema começa a comer o próprio produto.
Então a corroboração está comprometida no texto e no áudio gravado. Mas e a comunicação ao vivo, em tempo real? Aquela situação em que você espera ver os trejeitos da pessoa, em que dá para fazer uma pergunta e ver a pessoa responder. O funcionário da Arup em Hong Kong caiu numa chamada ao vivo. Mas isso deve ter exigido um orçamento pesado. A gente tem um caso documentado que mostra que o ao vivo também está comprometido, e sai barato. Em maio de 2024, alguém criou uma conta de WhatsApp usando uma foto pública de Mark Read. Ele é o CEO da WPP, o maior grupo de publicidade do mundo. O atacante marcou uma reunião no Microsoft Teams que parecia incluir ele e outro alto executivo.
Como é que eles fizeram uma reunião ao vivo sem o executivo de verdade? Usaram uma voz clonada por cima de imagens tiradas do YouTube. Durante a reunião, os atacantes escreviam no chat como se fossem o próprio Read, que ficava fora da câmera, enquanto o áudio clonado tocava por cima do vídeo. Que ousadia. Pois é. O alvo era o líder de uma agência do grupo WPP, a quem pediram que abrisse uma nova empresa. Era o primeiro passo de um pedido de dinheiro e de dados da empresa. Nesse caso específico, a instalação da crença não funcionou, e Read depois mandou um e-mail para a liderança, alertando todo mundo. Mas repara na mecânica. Nada nessa operação exigiu acesso a qualquer coisa privada. Eles usaram uma foto que qualquer um podia baixar e imagens que qualquer um podia ver.
O golpista te entrega o telefone 22:52
Pensa no truque mais antigo do repertório do golpista. A vítima começa a desconfiar do negócio. O golpista não discute. Ele acolhe a desconfiança. Diz: você tem razão em tomar cuidado. Não precisa acreditar em mim. Liga você mesmo para o banco. E te entrega o telefone. Só que quem está do outro lado da linha é o cúmplice do golpista. Quem fornece a verificação é o próprio atacante. E isso se encaixa perfeitamente no homem de Hong Kong lá do começo do episódio. A videochamada em que ele entrou não aconteceu apesar da desconfiança dele. Aconteceu por causa dela.
Ele pediu, na prática, para falar com o banco, e os atacantes estavam prontos exatamente para esse pedido. Ele não deixou de verificar. Foi a verificação que o pegou. Agora, quando alguém chega a esse ponto e entende a arquitetura, costuma procurar uma saída de emergência. Se eu não posso olhar mais de perto e não posso checar fontes, então vou ser mais cuidadoso em geral. Vou desconfiar mais de tudo o que eu vejo.
Três consolos, postos à prova 23:45
Existem três consolos que as pessoas buscam quando percebem que as defesas antigas estão falhando. O primeiro é simplesmente dizer que o apocalipse não aconteceu. E nisso a gente concorda totalmente. Muitos comentaristas previam que 2024 seria o ano em que os deepfakes iam quebrar a democracia, com o número enorme de eleições no calendário mundial. Mas, se você olhar os dados, menos de 1% da desinformação checada nos ciclos eleitorais de 2024 foi gerada por IA. O apocalipse previsto simplesmente não chegou do jeito que as pessoas anunciavam.
Até o contraexemplo mais famoso desmorona quando você olha de perto. Em setembro de 2023, dois dias antes da eleição parlamentar da Eslováquia, uma gravação de áudio fabricada se espalhou pela internet. Ela supostamente mostrava um candidato pró-europeu discutindo fraude eleitoral. O lado dele perdeu a eleição, e o episódio foi noticiado no mundo inteiro como a primeira eleição nacional decidida por um deepfake. Mas os dados não sustentam essa conclusão, não é? Não sustentam. Uma análise cuidadosa mostra que as pesquisas pré-eleitorais provavelmente estavam erradas por motivos independentes e bem conhecidos, ligados ao comparecimento dos eleitores e à dinâmica tradicional de campanha. A gente recusa explicitamente a afirmação de que a eleição da Eslováquia foi decidida por um deepfake.
Mas admitir que não houve apocalipse não traz consolo nenhum para quem está ouvindo. Porque o estrago não depende de um fake conseguir virar uma eleição nacional. O estrago acontece nas margens, no esforço de todo dia para saber o que é verdade. O que leva ao plano B de quem está ouvindo. O segundo consolo: vou simplesmente ser mais cuidadoso. É exatamente aí que a armadilha se fecha. Em 2019, os juristas Robert Chesney e Danielle Citron identificaram um conceito que chamaram de dividendo do mentiroso. Num mundo em que todo mundo sabe que fakes perfeitos são possíveis, uma pessoa flagrada por uma evidência verdadeira e incriminadora ganha uma rota de fuga. Ela pode simplesmente dizer que a evidência verdadeira é falsa. A defesa arma o atacante.
Então aumentar a consciência do público sobre os fakes, na verdade, faz as pessoas acreditarem menos em informação correta. Mas existe prova no mundo real de que esse dividendo está sendo sacado? As pessoas estão fazendo isso mesmo? Estão. Isso já chegou aos tribunais. Numa ação de indenização por morte envolvendo o Autopilot da Tesla, os advogados da empresa argumentaram que declarações públicas gravadas de Elon Musk não podiam ser aceitas como prova autêntica. Argumentaram que, como Musk é famoso, ele é alvo frequente de deepfakes e, portanto, as gravações podiam não ser reais.
Eles tentaram lançar dúvida sobre declarações reais, gravadas e documentadas. A juíza Evette Pennypacker rejeitou o argumento. Ela escreveu que, se o tribunal aceitasse essa tese, alguém numa posição de poder poderia dizer o que quisesse e depois se esconder atrás da possibilidade de deepfakes para não assumir a responsabilidade pelo que disse de verdade. Ela chamou o argumento de profundamente preocupante. E a gente viu exatamente o mesmo movimento de dois réus da invasão do Capitólio de 6 de janeiro, que argumentaram no tribunal que os vídeos em que eles aparecem no Capitólio podiam ter sido gerados por IA.
E políticos no mundo todo também estão usando esse dividendo, não é? Um político na Índia disse que uma gravação de áudio em que ele criticava o próprio partido era sintética, embora uma análise forense posterior tenha concluído que ela era autêntica. Um candidato na Turquia disse o mesmo de uma fita comprometedora divulgada antes de uma eleição. Em geral, essas alegações ainda não deram certo nos tribunais. Mas a frase agora está disponível, de graça, para toda figura pública flagrada por uma evidência verdadeira. Pensa na evidência como dinheiro. A falsificação não engana só quem está segurando a nota falsa de cem dólares. Se a falsificação acontece em escala, ela destrói a própria moeda. As pessoas deixam de aceitar papel-moeda. O deepfake tira a credibilidade da evidência verdadeira. O objetivo não é só fazer você acreditar numa mentira. É criar um mundo de verdades negáveis.
Existe um paralelo histórico para esse apagamento da verdade. O historiador David King colecionou pares de fotos, antes e depois, da União Soviética de Stálin. Ah, já vi algumas, sim. Tem uma foto famosa de 1937 de Stálin passeando à beira do Canal Moscou-Volga. Ao lado dele está Nikolay Yezhov, o chefe da polícia secreta. Depois que Yezhov caiu em desgraça e foi executado, em 1940, os retocadores do Estado o apagaram da foto. Preencheram com todo o cuidado o espaço onde ele estava com a água do canal e a beira da margem.
Existia toda uma indústria do apagamento. Eles não estavam alterando só uma imagem; estavam alterando a realidade retroativamente. O objetivo daquele regime não era necessariamente fazer o público acreditar que uma foto específica era a verdade absoluta, sem retoque. O objetivo era ensinar ao público que o registro histórico obedece ao poder. Porque, quando o registro obedece ao poder, checar o registro deixa de ser uma forma de escapar da lealdade e vira uma forma de lealdade. E isso cria um vazio para você e para mim, porque a mente humana não consegue funcionar à base de “não sei”. Você não consegue se orientar no mundo, nem mesmo decidir o que fazer com o seu dia, num estado permanente de julgamento suspenso. Então, quando a verificação morre, o que acontece com a crença? A crença volta ao arranjo medieval. Você acredita por lealdade: ao senhor, à igreja, à guilda, à tribo. Você olha para um conteúdo e não pergunta “isso é verdade?”. Você pergunta: “alguém como eu acredita nisso?”.
Quando a evidência morre, a crença não morre. Ela troca de dono.
As plataformas e a lei 28:48
O que leva ao último consolo em que as pessoas se apoiam quando ouvem tudo isso. As plataformas ou a lei não vão resolver isso? Com certeza tem gente inteligente construindo barreiras tecnológicas e legais para impedir a instalação de crenças falsas. Vamos olhar primeiro a lei. A gente volta ao caso da Eslováquia, não como a história de uma eleição decidida, mas como uma falha mecânica da lei. O áudio fabricado apareceu durante uma moratória pré-eleitoral de 48 horas, prevista em lei. É um período de silêncio em que a imprensa e os políticos não podem fazer declarações de campanha.
É uma lei feita para a era da mídia antiga, pensada para proteger a reta final de uma eleição da baixaria de última hora. E ela virou exatamente a janela do ataque. O fake pôde se espalhar pela internet enquanto as instituições criadas para desmenti-lo estavam proibidas por lei de falar, e as plataformas falharam. Igualmente presa ao passado, a política da principal plataforma para mídia manipulada, na época em que o áudio apareceu, cobria vídeo, mas não cobria áudio. A fabricação passou por uma brecha numa regra escrita para a geração anterior de fakes.
Mas e as soluções tecnológicas, tipo a assinatura criptográfica? Eu ouço toda hora gente falando em embutir no próprio arquivo um registro permanente, impossível de falsificar, que prove quando e como uma foto foi tirada. O esforço é real. O nome é C2PA. A Leica lançou em 2023 uma câmera que assina as fotos de fábrica. No nível do hardware, o Samsung Galaxy S25 e o Google Pixel 10 assinam imagens de fábrica. Mas olha o que acontece no uso comum. A maioria das plataformas, como WhatsApp ou Facebook, remove os metadados embutidos quando processa um upload.
Por que elas fazem isso? Elas comprimem o arquivo para economizar espaço no servidor. E, nisso, jogam fora, sem alarde, o selo criptográfico. E, mesmo que a plataforma preserve o selo, quem está vendo a imagem no celular pode simplesmente tirar um print. Todo o aparato de verificação criptográfica cai diante do botão de captura de tela. Você gera um arquivo novo, sem nenhuma ligação com o registro original. Além disso, tentar construir detectores automáticos é uma corrida armamentista em que o detector treina o gerador. Na literatura científica, dá para treinar um gerador diretamente contra um detector publicado. Cada detector lançado entrega ao próximo fake um gradiente para subir.
Então, se a lei é lenta demais e a tecnologia derrota a si mesma, o que é que ainda fica de pé?
Ferrari: o fake que perdeu 31:03
Em julho de 2024, um executivo da Ferrari começou a receber mensagens de WhatsApp de alguém que se apresentava como Benedetto Vigna, o CEO da empresa. Depois veio uma ligação. A voz ao telefone era a de Vigna, imitada à perfeição, até o sotaque típico do sul da Itália. O pretexto era uma aquisição confidencial, embalada na autoridade do CEO e na urgência de um negócio prestes a fechar. Exigia um hedge cambial imediato. Por que esse executivo escapou do ataque, e o funcionário da Arup em Hong Kong não? Ele tinha um software melhor de detecção de áudio instalado no celular?
Não tinha. Ele achou que tinha ouvido alguma coisa levemente estranha na entonação. Mas não ficou interrogando o áudio. Não chegou mais perto para escutar com mais atenção, que foi o que derrubou o homem de Hong Kong. Em vez disso, pediu à voz que dissesse o nome de um livro que Vigna tinha recomendado a ele poucos dias antes. O livro se chamava Decalogue of Complexity. E o fake não soube responder. A ligação acabou na hora. Vamos desenvolver essa imagem. Pensa no malware polimórfico. Nos primeiros tempos da computação, o antivírus funcionava olhando o conteúdo de um arquivo. Procurava assinaturas específicas, linhas de código malicioso. Mas aí os vírus ficaram polimórficos. Eles reescreviam o próprio código enquanto se espalhavam, e nenhuma cópia ficava igual à outra. A segurança sobreviveu passando para a detecção comportamental. Pararam de olhar o arquivo em si e começaram a observar o que o arquivo tentava fazer. Que permissões ele pede? O que ele está tentando acessar? O executivo da Ferrari se apoiou na detecção comportamental. Ele se apoiou num pedaço de história compartilhada que existia fora do canal.
Uma mentira pode vestir qualquer rosto. Ela não pode pular a porta.
De olho na porta 32:34
E essa é a virada. É a percepção que a gente veio construindo até aqui: tentar responder à pergunta “isso é real?” examinando a própria mensagem é uma guerra perdida. Os pixels, as frequências do áudio, os sites que confirmam a história, tudo isso é a camada do conteúdo. E a camada do conteúdo caiu. Mas toda mensagem ainda precisa fazer uma coisa que não dá para automatizar. Ela precisa entrar numa mente humana. Precisa instalar uma crença. Ou seja, você e eu precisamos parar de interrogar o rosto e começar a ficar de olho na porta. É isso que revela a disciplina que dá nome ao nosso programa, a pistomecânica: o estudo da engenharia da crença.
Quando você aplica a pistomecânica, troca a pergunta sem resposta, “isso é real?”, por três perguntas sobre comportamento. Primeira: o que isso está tentando instalar em mim? Segunda: por qual porta está entrando? Está chegando pela emoção, pela autoridade, pela repetição, pela urgência ou pelo pertencimento? E terceira: por que está chegando agora? Espera, vamos testar essas três perguntas na nossa própria conversa, agora mesmo. Vamos olhar exatamente esta hora de áudio. O que esta hora está tentando instalar em quem ouve? E por qual porta está entrando?
É um teste justo. A gente está, sem dúvida, usando a autoridade. A gente apresenta dados, cita juízes e estudos de psicologia. Usa a repetição. A gente está, ativamente, montando uma crença sobre o fracasso do antigo ambiente de mídia. Está estruturando a conversa para fazer quem ouve aceitar que as defesas antigas morreram. É por isso que observar essas portas é o primeiro movimento que um estudante de pistomecânica faz. Você para de interrogar os pixels e passa a interrogar a mecânica da entrega. Não “isso é real?”, mas “o que isso está fazendo?”. O sistema imunológico que vem depois é um letramento, não uma tecnologia. É fluência na mecânica da instalação. A arte humana. As três primeiras horas desta série não foram só um diagnóstico do problema. Foram treinamento básico.
Quem acompanhou as quatro horas já é, a essa altura, um estudante de pistomecânica. Mas tem um limite honesto que a gente precisa deixar claro: letramento não é invulnerabilidade. Saber como as portas funcionam não faz as portas sumirem. Uma mente treinada continua tendo portas. A única diferença é que o limiar é cruzado com a luz acesa, e não no escuro. Por baixo de toda crença existe uma pela qual todas as outras passam primeiro. As pessoas mentem para si mesmas para protegê-la e mudam uma vida inteira numa tarde para não perdê-la. Ela foi instalada antes que alguém pedisse permissão a elas. O fake da Ferrari tinha tudo, menos essa.
Na semana que vem, a gente abre essa crença. Do que ela é feita e quem a colocou ali. Porque as portas são poucas, e cada uma delas pode ser aprendida. Na semana que vem, a gente desce mais uma camada. Esse foi o Podcast de Pistomecânica. O que pode ser estudado pode ser aprendido.