PDF Kami Alojado en Europa

Blog

Lo que los metadatos de tu PDF dicen de ti

Autor, programa, nombre de usuario, rutas de tus carpetas, versiones anteriores, ubicación GPS de las fotos: un PDF lleva mucho más de lo que muestra. Casos célebres, un estudio sobre 39 664 PDF de agencias de seguridad y cómo revisar y limpiar un archivo antes de enviarlo.

En febrero de 2003, Downing Street, la oficina del primer ministro británico, publica un dosier sobre las armas de Irak. El documento, pensado para justificar una guerra, resulta estar copiado en parte de la tesis de un estudiante. Pero el golpe de gracia se lo da un detalle invisible: un informático, Richard M. Smith, abre el archivo y encuentra en él los nombres de usuario de los cuatro funcionarios que lo habían modificado, además de las rutas de sus carpetas de trabajo (análisis de R. M. Smith). Desde entonces se le conoce como el «dodgy dossier», el dosier dudoso.

Dos años después, en Estados Unidos, el asesino en serie BTK, que llevaba treinta años escapando de la policía, envía un disquete a una televisión local. En él hay un documento de Word borrado que lleva dos metadatos: «Christ Lutheran Church» y «Dennis». Dennis Rader es detenido nueve días después (Wikipedia).

Los dos casos tienen que ver con archivos de Word. Pero un PDF suele heredar esa información al convertirse, y además añade la suya. Esto es lo que puede contener sin que nada aparezca en pantalla.

¿Qué contiene un PDF, además de sus páginas?

Una ficha de identidad. Todo PDF puede llevar un diccionario de información: título, autor, asunto, palabras clave, programa de origen («Creator»), motor que ha generado el PDF («Producer»), fecha de creación y fecha de modificación (ISO 32000). El campo del autor suele rellenarse automáticamente con el nombre de la cuenta del ordenador o de la licencia de Office.

Una segunda ficha, más indiscreta. Los PDF modernos también contienen metadatos en formato XMP, que pueden incluir un identificador único que sigue al documento de versión en versión y un historial de los pasos de edición (Meridian Discovery). Borrar la primera ficha no basta si te olvidas de la segunda.

Las versiones anteriores. Cuando guardas un PDF modificado, muchos programas no reescriben el archivo: añaden los cambios al final. La versión antigua sigue dentro del archivo y se puede extraer (Eclectic Light). Así fue como, en 2008, el investigador Didier Stevens reconstruyó paso a paso el trabajo del autor de un PDF malicioso, a partir de cinco actualizaciones sucesivas conservadas en el archivo (Didier Stevens).

Los metadatos de las imágenes. Una foto incrustada en un PDF puede conservar sus propios datos EXIF: modelo de móvil, fecha y, a veces, coordenadas GPS. En 2012, el fundador del antivirus McAfee, entonces en fuga, fue localizado en Guatemala por las coordenadas GPS de una foto publicada por unos periodistas (NPR). La CNIL —la autoridad francesa de protección de datos— recuerda que las fotos suelen registrar el lugar y la hora en que se tomaron (CNIL).

Y todo lo demás. Comentarios de revisión, archivos adjuntos, capas ocultas, datos de formularios, texto blanco sobre fondo blanco: ya en 2008, la NSA publicó una guía que recogía once categorías de información oculta en los PDF que había que revisar antes de publicar nada (NSA, 2008).

Lo que un PDF lleva bajo la página visible: ficha de información (autor, programa, fechas), metadatos XMP con historial, versiones anteriores conservadas por los sucesivos guardados, imágenes con sus datos EXIF y GPS, comentarios y archivos adjuntos

¿Hasta los profesionales de la seguridad caen en la trampa?

Sí, y se ha medido. En 2021, Supriya Adhatarao y Cédric Lauradoux, investigadores de la Universidad Grenoble Alpes y del Inria (el instituto público francés de investigación en informática), analizaron 39 664 PDF publicados por 75 agencias de seguridad de 47 países. Según su estudio, el 76 % revelaba el programa con el que se había generado; el 42 %, el sistema operativo, y un tercio, la identidad de su autor. Solo una cuarta parte se había sometido a una limpieza, y apenas una minoría a una limpieza completa (Adhatarao y Lauradoux, 2021).

Más recientemente, en diciembre de 2025, la PDF Association diseccionó los miles de PDF publicados por el Departamento de Justicia de Estados Unidos en el caso Epstein. La censura de los pasajes ocultos era correcta, pero los archivos conservaban actualizaciones sucesivas y fichas de información «huérfanas», invisibles en los lectores de PDF habituales, que delataban las herramientas y el calendario de su preparación (PDF Association).

¿Por qué debería importarte?

Un currículum puede revelar el nombre de la empresa en la que trabajas ahora: su licencia de Office lo ha puesto como «autor». Un presupuesto puede revelar qué programa usas, y qué versión. Un informe enviado a un cliente puede llevar el nombre de quien lo redactó en realidad, o la versión anterior a las correcciones. Un justificante hecho con fotos puede indicar dónde se tomaron. Ninguno de estos datos es peligroso en sí mismo; cada uno puede decir más de lo que querrías.

Para un profesional, el asunto tiene además una vertiente jurídica. Un archivo enviado a un cliente o publicado en internet puede contener nombres de compañeros, comentarios internos o versiones anteriores. Y el RGPD establece un principio de minimización: solo deben tratarse los datos «necesarios para la finalidad perseguida», según «la política del “mínimo imprescindible”» (LegalPlace). Difundir los datos ocultos de un documento es difundir más de lo necesario.

La autoridad británica de protección de datos lo resume en una frase: «Los archivos rara vez contienen solo la información que ha introducido su autor» (ICO).

¿Cómo ver los metadatos de un PDF?

Cómo eliminar los metadatos de un PDF y qué trampas evitar

En el origen es más sencillo. Antes de exportar a PDF, revisa las propiedades del documento en tu procesador de textos (en Word: Archivo › Información › Comprobar si hay problemas › Inspeccionar documento). Cuanta menos información haya al principio, menos tendrás que limpiar después.

Las herramientas especializadas. Adobe Acrobat Pro ofrece una función «Quitar información oculta» y otra que limpia el documento por completo (Adobe). Es la herramienta que el estudio de Grenoble consideró más eficaz.

Tres trampas frecuentes.

El método radical: reconstruir el PDF a partir de imágenes. Convertir cada página en una imagen y rehacer después un PDF solo con esas imágenes elimina todo lo que no se ve: ficha de información, XMP, versiones anteriores, capas, adjuntos. La herramienta libre mat2, pensada para limpiar archivos, funciona así por defecto (mat2). El precio: el texto ya no se puede seleccionar y el archivo pesa más. Es el principio de Censurar PDF de PDFKami, que reconstruye en tu navegador un PDF hecho solo con las imágenes de las páginas, sin ficha de información ni XMP. La herramienta sirve ante todo para ocultar un pasaje, y explicamos por qué este método es el único fiable para hacerlo en La falsa censura en los PDF.

Y no dejes la limpieza en manos de cualquiera. Subir un documento a una web para quitarle la información sensible es entregar esa información a un tercero. Limpiarlo en local evita la paradoja.

Glosario

Metadatos: datos que describen un archivo (autor, fechas, programa) en lugar de su contenido.

Diccionario de información: la ficha estándar de un PDF, con el título, el autor, el programa y las fechas.

XMP: formato de metadatos creado por Adobe, guardado en XML dentro del archivo, que puede contener un historial de modificaciones.

Actualización incremental: forma de guardar que añade los cambios al final del archivo sin borrar la versión anterior.

EXIF: metadatos de las fotos (cámara, ajustes, fecha y, a veces, posición GPS).

Rasterizar: convertir una página en imagen, lo que elimina todo lo que no es visible.

FAQ

¿Qué son los metadatos de un PDF?

La información que describe el archivo: título, autor, programa utilizado, fechas de creación y de modificación y, a veces, un historial de cambios.

¿Cómo ver los metadatos de un PDF?

En las propiedades del documento de tu lector de PDF, para la ficha de información, y con ExifTool, para una lectura exhaustiva, XMP incluido. Analizar un PDF de PDFKami señala además, sin enviar el archivo, los adjuntos y los elementos activos.

¿Puede un PDF contener la ubicación GPS?

Sí, si lleva fotos incrustadas con sus metadatos EXIF originales.

¿Basta con borrar el autor en las propiedades?

No. El PDF también puede contener metadatos XMP, versiones anteriores e imágenes con sus propios metadatos.

¿Cuál es el método más seguro para limpiar un PDF?

Reconstruir el PDF a partir de imágenes de las páginas. Todo lo que no se ve desaparece, a cambio de que el texto ya no se pueda seleccionar.

¿Limpian sus PDF las agencias de seguridad?

Rara vez del todo: un estudio de 2021 sobre 39 664 PDF de agencias de seguridad mostró que un tercio revelaba a su autor y que solo una cuarta parte se había limpiado.

Sigue leyendo

← Todos los artículos