PDF Kami Alojado na Europa

Blog

O que os metadados do seu PDF dizem sobre si

Autor, software, nome de utilizador, caminho das suas pastas, versões anteriores, localização GPS das fotografias: um PDF transporta muito mais do que mostra. Casos célebres, um estudo sobre 39 664 PDF de agências de segurança e como verificar e limpar um ficheiro antes de o enviar.

Em fevereiro de 2003, o gabinete do primeiro-ministro britânico publica um dossier sobre as armas iraquianas. O documento, destinado a justificar uma guerra, revela-se em parte copiado de uma tese de estudante. Mas o golpe final vem de um pormenor invisível: um informático, Richard M. Smith, abre o ficheiro e encontra nele os nomes de utilizador dos quatro funcionários que o tinham alterado, bem como os caminhos das suas pastas de trabalho (análise de R. M. Smith). Desde então, o documento é conhecido como «dodgy dossier», o dossier duvidoso.

Dois anos mais tarde, nos Estados Unidos, o assassino em série BTK, que escapou à polícia durante trinta anos, envia uma disquete a uma televisão local. Nela, um documento Word apagado traz dois metadados: «Christ Lutheran Church» e «Dennis». Dennis Rader é detido nove dias depois (Wikipédia).

Os dois casos envolvem ficheiros Word. Mas um PDF herda muitas vezes estas informações na conversão, e acrescenta-lhes outras. Eis o que pode conter sem que nada apareça no ecrã.

O que contém um PDF, para além das páginas?

Uma ficha de identidade. Cada PDF pode ter um dicionário de informações: título, autor, assunto, palavras-chave, software de origem («Creator»), motor que produziu o PDF («Producer»), data de criação, data de modificação (ISO 32000). O autor é muitas vezes preenchido automaticamente com o nome da conta do computador ou da licença do Office.

Uma segunda ficha, mais faladora. Os PDF modernos contêm também metadados no formato XMP, que podem incluir um identificador único que acompanha o documento de versão em versão e um histórico das etapas de modificação (Meridian Discovery). Apagar a primeira ficha não chega se esquecer a segunda.

As versões anteriores. Quando se guarda um PDF modificado, muitos programas não reescrevem o ficheiro: acrescentam as alterações no fim. A versão antiga fica no ficheiro, e pode ser extraída (Eclectic Light). Foi assim que, em 2008, o investigador Didier Stevens reconstituiu, passo a passo, o trabalho do autor de um PDF malicioso a partir de cinco atualizações sucessivas conservadas no ficheiro (Didier Stevens).

Os metadados das imagens. Uma fotografia integrada num PDF pode conservar os seus próprios dados EXIF: modelo do telemóvel, data e, por vezes, coordenadas GPS. Em 2012, o fundador do antivírus McAfee, então em fuga, foi localizado na Guatemala por causa das coordenadas GPS de uma fotografia publicada por jornalistas (NPR). A CNIL — a autoridade francesa de proteção de dados — lembra que as fotografias contêm muitas vezes o local e a hora em que foram tiradas (CNIL).

E o resto. Comentários de revisão, anexos, camadas ocultas, dados de formulário, texto branco sobre fundo branco: já em 2008, a NSA publicou um guia que enumera onze categorias de informações escondidas nos PDF, a verificar antes de qualquer publicação (NSA, 2008).

O que um PDF transporta por baixo da página visível: ficha de informações (autor, software, datas), metadados XMP com histórico, versões anteriores mantidas de cada vez que o ficheiro é guardado, imagens com os seus dados EXIF e GPS, comentários e anexos

Até os profissionais de segurança se deixam apanhar?

Sim, e foi medido. Em 2021, dois investigadores da Universidade Grenoble Alpes e do Inria, o instituto público francês de investigação em ciências digitais, Supriya Adhatarao e Cédric Lauradoux, analisaram 39 664 PDF publicados por 75 agências de segurança de 47 países. Segundo o estudo, 76% revelavam o software que os tinha produzido, 42% o sistema operativo e um terço a identidade do autor. Só um quarto tinha passado por alguma limpeza, e apenas uma minoria por uma limpeza completa (Adhatarao e Lauradoux, 2021).

Mais recentemente, em dezembro de 2025, a PDF Association dissecou os milhares de PDF publicados pelo Departamento de Justiça norte-americano no caso Epstein. As rasuras, essas, estavam bem feitas; mas os ficheiros conservavam atualizações sucessivas e fichas de informações «órfãs», invisíveis nos leitores de PDF comuns, que denunciavam as ferramentas e o calendário da sua preparação (PDF Association).

Porque é que isto é importante para si?

Um CV pode revelar o nome do seu empregador atual, inscrito como «autor» pela licença do Office da empresa. Um orçamento pode revelar o software e a versão que utiliza. Um relatório enviado a um cliente pode trazer o nome da pessoa que realmente o redigiu, ou a versão antiga, anterior às correções. Um comprovativo montado a partir de fotografias pode indicar onde foram tiradas. Nenhuma destas informações é perigosa em si; qualquer uma pode dizer mais do que gostaria.

Para um profissional, a questão é também jurídica. Um ficheiro enviado a um cliente ou publicado online pode conter nomes de colegas, comentários internos ou versões anteriores. Ora, o RGPD estabelece um princípio de minimização: só devem ser tratados os dados «necessários à finalidade pretendida», segundo «a política do “estrito mínimo”» (LegalPlace). Divulgar os dados escondidos de um documento é divulgar mais do que o necessário.

O ICO, a autoridade britânica de proteção de dados, resume-o numa frase: «Os ficheiros raramente contêm apenas a informação introduzida pelo autor» (ICO).

Como ver os metadados de um PDF?

Como remover os metadados, e as armadilhas a evitar

Na origem, é mais simples. Antes de exportar para PDF, verifique as propriedades do documento no seu processador de texto (no Word: Ficheiro › Informações › Verificar Existência de Problemas › Inspecionar Documento). Menos informação à partida, menos para limpar depois.

As ferramentas especializadas. O Adobe Acrobat Pro tem uma função para remover as informações ocultas e outra que limpa o documento por completo (Adobe). É a ferramenta que o estudo de Grenoble considerou mais eficaz.

Três armadilhas frequentes.

O método radical: reconstruir o PDF a partir de imagens. Converter cada página em imagem e, depois, reconstituir um PDF só com essas imagens elimina tudo o que não é visível: ficha de informações, XMP, versões anteriores, camadas, anexos. A ferramenta livre mat2, concebida para limpar ficheiros, procede assim por defeito (mat2). O preço a pagar: o texto deixa de ser selecionável, e o ficheiro fica mais pesado. É o princípio do Rasurar PDF do PDFKami, que reconstrói no seu navegador um PDF feito apenas das imagens das páginas, sem ficha de informações nem XMP; a ferramenta serve sobretudo para tapar um trecho, e explicamos porque é que este método é o único fiável para isso em A falsa rasura em PDF.

E não entregue a limpeza a qualquer um. Carregar um documento num site para lhe retirar as informações sensíveis é o mesmo que transmitir essas informações a um terceiro. Uma limpeza local evita este paradoxo.

Glossário

Metadados: dados que descrevem um ficheiro (autor, datas, software) e não o seu conteúdo.

Dicionário de informações: a ficha normalizada de um PDF, com o título, o autor, o software e as datas.

XMP: formato de metadados criado pela Adobe, guardado em XML dentro do ficheiro, que pode conter um histórico de modificações.

Atualização incremental: forma de guardar que acrescenta as alterações no fim do ficheiro sem apagar a versão antiga.

EXIF: metadados das fotografias (câmara, definições, data, por vezes localização GPS).

Rasterizar: converter uma página em imagem, o que elimina tudo o que não é visível.

FAQ

O que são os metadados de um PDF?

As informações que descrevem o ficheiro: título, autor, software utilizado, datas de criação e de modificação e, por vezes, um histórico das modificações.

Como ver os metadados de um PDF?

Nas propriedades do documento do seu leitor de PDF, para a ficha de informações; com o ExifTool, para uma leitura exaustiva, XMP incluído. A ferramenta Analisar um PDF do PDFKami assinala ainda, sem enviar o ficheiro, os anexos e os elementos ativos.

Um PDF pode conter a localização GPS?

Sim, se tiver fotografias integradas com os seus metadados EXIF originais.

Apagar o autor nas propriedades chega?

Não. O PDF pode também conter metadados XMP, versões anteriores e imagens com os seus próprios metadados.

Qual é o método mais seguro para limpar um PDF?

Reconstruir o PDF a partir de imagens das páginas. Tudo o que não é visível desaparece, à custa de um texto que deixa de ser selecionável.

As agências de segurança limpam os seus PDF?

Raramente por completo: um estudo de 2021 sobre 39 664 PDF de agências de segurança mostrou que um terço revelava o autor e que só um quarto tinha sido limpo.

Ler a seguir

← Todos os artigos