Em fevereiro de 2003, o gabinete do primeiro-ministro britânico publica um dossier sobre as armas iraquianas. O documento, destinado a justificar uma guerra, revela-se em parte copiado de uma tese de estudante. Mas o golpe final vem de um pormenor invisível: um informático, Richard M. Smith, abre o ficheiro e encontra nele os nomes de utilizador dos quatro funcionários que o tinham alterado, bem como os caminhos das suas pastas de trabalho (análise de R. M. Smith). Desde então, o documento é conhecido como «dodgy dossier», o dossier duvidoso.
Dois anos mais tarde, nos Estados Unidos, o assassino em série BTK, que escapou à polícia durante trinta anos, envia uma disquete a uma televisão local. Nela, um documento Word apagado traz dois metadados: «Christ Lutheran Church» e «Dennis». Dennis Rader é detido nove dias depois (Wikipédia).
Os dois casos envolvem ficheiros Word. Mas um PDF herda muitas vezes estas informações na conversão, e acrescenta-lhes outras. Eis o que pode conter sem que nada apareça no ecrã.
O que contém um PDF, para além das páginas?
Uma ficha de identidade. Cada PDF pode ter um dicionário de informações: título, autor, assunto, palavras-chave, software de origem («Creator»), motor que produziu o PDF («Producer»), data de criação, data de modificação (ISO 32000). O autor é muitas vezes preenchido automaticamente com o nome da conta do computador ou da licença do Office.
Uma segunda ficha, mais faladora. Os PDF modernos contêm também metadados no formato XMP, que podem incluir um identificador único que acompanha o documento de versão em versão e um histórico das etapas de modificação (Meridian Discovery). Apagar a primeira ficha não chega se esquecer a segunda.
As versões anteriores. Quando se guarda um PDF modificado, muitos programas não reescrevem o ficheiro: acrescentam as alterações no fim. A versão antiga fica no ficheiro, e pode ser extraída (Eclectic Light). Foi assim que, em 2008, o investigador Didier Stevens reconstituiu, passo a passo, o trabalho do autor de um PDF malicioso a partir de cinco atualizações sucessivas conservadas no ficheiro (Didier Stevens).
Os metadados das imagens. Uma fotografia integrada num PDF pode conservar os seus próprios dados EXIF: modelo do telemóvel, data e, por vezes, coordenadas GPS. Em 2012, o fundador do antivírus McAfee, então em fuga, foi localizado na Guatemala por causa das coordenadas GPS de uma fotografia publicada por jornalistas (NPR). A CNIL — a autoridade francesa de proteção de dados — lembra que as fotografias contêm muitas vezes o local e a hora em que foram tiradas (CNIL).
E o resto. Comentários de revisão, anexos, camadas ocultas, dados de formulário, texto branco sobre fundo branco: já em 2008, a NSA publicou um guia que enumera onze categorias de informações escondidas nos PDF, a verificar antes de qualquer publicação (NSA, 2008).
Até os profissionais de segurança se deixam apanhar?
Sim, e foi medido. Em 2021, dois investigadores da Universidade Grenoble Alpes e do Inria, o instituto público francês de investigação em ciências digitais, Supriya Adhatarao e Cédric Lauradoux, analisaram 39 664 PDF publicados por 75 agências de segurança de 47 países. Segundo o estudo, 76% revelavam o software que os tinha produzido, 42% o sistema operativo e um terço a identidade do autor. Só um quarto tinha passado por alguma limpeza, e apenas uma minoria por uma limpeza completa (Adhatarao e Lauradoux, 2021).
Mais recentemente, em dezembro de 2025, a PDF Association dissecou os milhares de PDF publicados pelo Departamento de Justiça norte-americano no caso Epstein. As rasuras, essas, estavam bem feitas; mas os ficheiros conservavam atualizações sucessivas e fichas de informações «órfãs», invisíveis nos leitores de PDF comuns, que denunciavam as ferramentas e o calendário da sua preparação (PDF Association).
Porque é que isto é importante para si?
Um CV pode revelar o nome do seu empregador atual, inscrito como «autor» pela licença do Office da empresa. Um orçamento pode revelar o software e a versão que utiliza. Um relatório enviado a um cliente pode trazer o nome da pessoa que realmente o redigiu, ou a versão antiga, anterior às correções. Um comprovativo montado a partir de fotografias pode indicar onde foram tiradas. Nenhuma destas informações é perigosa em si; qualquer uma pode dizer mais do que gostaria.
Para um profissional, a questão é também jurídica. Um ficheiro enviado a um cliente ou publicado online pode conter nomes de colegas, comentários internos ou versões anteriores. Ora, o RGPD estabelece um princípio de minimização: só devem ser tratados os dados «necessários à finalidade pretendida», segundo «a política do “estrito mínimo”» (LegalPlace). Divulgar os dados escondidos de um documento é divulgar mais do que o necessário.
O ICO, a autoridade britânica de proteção de dados, resume-o numa frase: «Os ficheiros raramente contêm apenas a informação introduzida pelo autor» (ICO).
Como ver os metadados de um PDF?
- Num leitor de PDF: as propriedades do documento, no menu Ficheiro, mostram a ficha de informações (título, autor, software, datas). É a ponta do icebergue.
- Com a ferramenta Analisar um PDF do PDFKami, para o que as propriedades não mostram: inspeciona o ficheiro no seu navegador, sem o enviar, e assinala os anexos, os formulários e os elementos ativos. Não lê a ficha de informações, que as propriedades do leitor já mostram.
- Com o ExifTool, uma ferramenta livre de linha de comandos, para uma leitura exaustiva, incluindo os metadados XMP (ExifTool).
Como remover os metadados, e as armadilhas a evitar
Na origem, é mais simples. Antes de exportar para PDF, verifique as propriedades do documento no seu processador de texto (no Word: Ficheiro › Informações › Verificar Existência de Problemas › Inspecionar Documento). Menos informação à partida, menos para limpar depois.
As ferramentas especializadas. O Adobe Acrobat Pro tem uma função para remover as informações ocultas e outra que limpa o documento por completo (Adobe). É a ferramenta que o estudo de Grenoble considerou mais eficaz.
Três armadilhas frequentes.
- Apagar a ficha de informações mas não o XMP, ou o contrário. Os dois coexistem muitas vezes.
- Guardar por cima. Muitas ferramentas, incluindo o ExifTool, acrescentam as alterações no fim do ficheiro: a documentação do ExifTool avisa que as informações antigas nunca são realmente eliminadas, e recomenda reescrever o ficheiro a seguir (ExifTool). O estudo de Grenoble mostrou que uma limpeza com o ExifTool só eliminava a referência aos metadados, não os próprios metadados: encontrou-os em todos os PDF tratados dessa forma.
- Esquecer as imagens. Mantêm os seus próprios metadados, que as ferramentas de limpeza de PDF nem sempre detetam.
O método radical: reconstruir o PDF a partir de imagens. Converter cada página em imagem e, depois, reconstituir um PDF só com essas imagens elimina tudo o que não é visível: ficha de informações, XMP, versões anteriores, camadas, anexos. A ferramenta livre mat2, concebida para limpar ficheiros, procede assim por defeito (mat2). O preço a pagar: o texto deixa de ser selecionável, e o ficheiro fica mais pesado. É o princípio do Rasurar PDF do PDFKami, que reconstrói no seu navegador um PDF feito apenas das imagens das páginas, sem ficha de informações nem XMP; a ferramenta serve sobretudo para tapar um trecho, e explicamos porque é que este método é o único fiável para isso em A falsa rasura em PDF.
E não entregue a limpeza a qualquer um. Carregar um documento num site para lhe retirar as informações sensíveis é o mesmo que transmitir essas informações a um terceiro. Uma limpeza local evita este paradoxo.
Glossário
Metadados: dados que descrevem um ficheiro (autor, datas, software) e não o seu conteúdo.
Dicionário de informações: a ficha normalizada de um PDF, com o título, o autor, o software e as datas.
XMP: formato de metadados criado pela Adobe, guardado em XML dentro do ficheiro, que pode conter um histórico de modificações.
Atualização incremental: forma de guardar que acrescenta as alterações no fim do ficheiro sem apagar a versão antiga.
EXIF: metadados das fotografias (câmara, definições, data, por vezes localização GPS).
Rasterizar: converter uma página em imagem, o que elimina tudo o que não é visível.