Caso de éxito · Sector público

Anonimiza 5.000 PDF al año sin abrir uno solo

RelevX Redactor detecta y oculta datos personales en documentos oficiales de forma automática. Lo desarrollamos para el Ajuntament de Santa Coloma de Gramenet y les devolvió más de 1.600 horas al año.

+1.600 h
Ahorradas al año
20 min
Por documento, antes
3 s
Por documento, ahora
Antes y después

Esto es lo que hace en 3 segundos

A la izquierda, un documento tal y como sale. A la derecha, el mismo documento listo para publicar.

Resolución 2024/0417
A instancia de NOMBRE con documento DNI
domiciliado en DIRECCIÓN
teléfono TELÉFONO y correo EMAIL
e ingreso en la cuenta IBAN

Original · 6 datos personales

Resolución 2024/0417
A instancia de con documento
domiciliado en
teléfono y correo
e ingreso en la cuenta

Anonimizado · listo para publicar

El problema: 20 minutos por documento, 5.000 documentos al año

Toda administración pública que publica documentación (sentencias, contratos, actas, resoluciones) está obligada a eliminar antes los datos personales que contiene. Lo exige el RGPD y lo exige la LOPDGDD. No es opcional y no admite atajos.

El problema es que hacerlo bien es lento. Hay que leer el documento entero, localizar cada nombre, cada DNI, cada dirección, cada número de cuenta, y taparlos uno a uno. En Santa Coloma eran unos 20 minutos por documento. Multiplicado por 5.000 documentos al año, son más de 1.600 horas: el equivalente a una persona a jornada completa dedicada exclusivamente a tachar datos.

Y lo peor no es el tiempo. Es que un proceso manual y repetitivo a esa escala falla. Basta con que a alguien se le pase un apellido en la página once de un documento de treinta para que ese PDF salga publicado con un dato personal dentro. En una administración pública, eso no es un descuido: es una brecha de datos con obligación de notificación.

Cómo funciona

Arrastrar, revisar, exportar

Tres pasos. El segundo es opcional y es justo el que hace que se pueda confiar en el resultado.

01

Arrastras los documentos

Uno o doscientos. La aplicación los abre, extrae el texto y localiza los datos personales: nombres y apellidos, DNI y NIE, direcciones postales, teléfonos, correos, IBAN y tarjetas bancarias, matrículas y números de expediente.

02

Revisas lo dudoso

La aplicación marca lo que ha detectado y separa lo que tiene claro de lo que no. Un IBAN tiene un formato inequívoco; un nombre propio que también es un topónimo, no. Esa segunda lista te la enseña para que decidas tú, y puedes añadir a mano lo que quieras tapar aunque no lo haya detectado.

Cada corrección se recuerda

03

Exportas el PDF limpio

El documento sale con los datos tapados de verdad, no ocultos bajo un rectángulo negro que se puede quitar copiando el texto. Se genera además un registro de qué se anonimizó en cada archivo.

RelevX Redactor procesando un lote de seis PDF con el panel de validación de entidades
Un lote de seis documentos en proceso. Izquierda, el original con las entidades resaltadas por color; centro, el resultado; derecha, las 35 entidades detectadas para validar una a una.

Por qué importa que corra en tu ordenador

La mayoría de herramientas de anonimización suben tus documentos a un servidor. Eso cambia el problema legal por completo.

En local, como Redactor
  • El documento no sale del equipo ni de la red de la organización
  • No hay transferencia de datos que documentar ni justificar
  • No hace falta contrato de encargado del tratamiento con un tercero
  • Funciona sin conexión a internet
  • Ningún proveedor externo puede sufrir una brecha con tus documentos dentro
En la nube
  • Cada documento subido es una cesión de datos a un tercero
  • Exige contrato de encargado del tratamiento y análisis de riesgos
  • Si el servidor está fuera de la UE, hay que justificar la transferencia internacional
  • Depende de la conexión y de que el servicio siga existiendo
  • Una brecha en el proveedor es una brecha tuya, y tuya es la notificación

Qué reconoce

Y en cualquiera de las formas en que aparezca escrito, no solo en la que esperas.

PersonaNombres y apellidosMaría Pérez García
IDs / DocsDNI, NIE y NIF12345678Z
LugarDireccionesC/ Mayor 14, 3º B
OtrosTeléfonos600 123 456
OtrosCorreosnombre@dominio.es
IDs / DocsIBANES91 2100 0418 45…
IDs / DocsTarjetas4532 •••• •••• 9021
OtrosMatrículas1234 BCD
IDs / DocsExpedientesEXP-2024/0417
IDs / DocsSeguridad Social08 12345678 90
OrganizaciónEmpresas y organismosAsteria Sistemas, S.L.
+ lo que necesite tu organización
se añaden campos a medida
Persona Lugar Organización IDs y documentos Otros

Esta es la base, no el límite. El conjunto se amplía con los campos que necesite cada organización: un juzgado, un ayuntamiento y una clínica no manejan los mismos datos ni los llaman igual, y hay información que en un contexto identifica a alguien y en otro no.

Lo que lo hace distinto

Aprende de tus documentos

Cada validación que haces le enseña algo. El sistema tiene memoria y va afinando solo con el uso.

Cuando confirmas que un fragmento era un nombre, o cuando marcas a mano algo que no había detectado, esa corrección no se pierde al cerrar el documento. El sistema la retiene y la aplica a los siguientes.

El efecto práctico se nota rápido: los primeros documentos de una organización requieren más revisión, porque el sistema todavía no conoce vuestra forma de redactar, vuestros formatos de expediente ni cómo nombráis a las partes. A medida que se procesan más, la lista de dudas se acorta y la revisión pasa de ser una tarea a ser un vistazo.

Es la diferencia entre una herramienta que hace siempre lo mismo y una que se adapta a cómo trabajáis. Y es también la razón por la que el paso de validación no es un estorbo: cada minuto que dedicas a corregir hoy es tiempo que no vas a dedicar mañana.

Documentos sueltos o lotes enteros

Puedes trabajar documento a documento o cargar un lote completo y procesarlo de una vez. Cada archivo del lote mantiene su propio panel de validación, y cuando están todos revisados se descargan juntos.

Para una publicación mensual de resoluciones, esto cambia la escala del trabajo: no es anonimizar un documento cincuenta veces, es lanzar el lote, revisar lo que el sistema marca como dudoso y descargar.

Si quieres verlo en movimiento, en redactor.relevx.com está la web del producto, con más detalle técnico y la opción de reservar una demo. Está en castellano, catalán e inglés.

Una sentencia civil antes y después de pasar por RelevX Redactor, con los datos personales eliminados del PDF final
El documento original con las entidades detectadas y, encima, el PDF ya anonimizado. Los datos no están tapados con un rectángulo: están fuera del archivo.

Por qué no basta con buscar y reemplazar

Es la primera pregunta que hace todo el mundo, y es razonable. La respuesta es que los datos personales no aparecen siempre escritos igual.

La misma persona puede figurar de formas muy distintas dentro del mismo documento. Un DNI puede llevar guion o no llevarlo. Una dirección puede estar partida en tres líneas.

Cómo aparece en el documento Buscar y reemplazar RelevX Redactor
María Pérez García
Pérez García, María no
Dña. María Pérez no
la demandante no
Datos detectados 1 de 4 4 de 4

Por eso el sistema no busca cadenas de texto: interpreta el documento. Entiende que un fragmento está funcionando como nombre de persona por el papel que ocupa en la frase, aunque no lo haya visto nunca. Y por eso mismo el paso de revisión existe: cuando la interpretación no es segura, se pregunta en lugar de decidir por su cuenta.

Anonimizar no es lo mismo que seudonimizar

La distinción parece de matiz y no lo es: determina si el documento sigue estando sujeto al RGPD o deja de estarlo.

Seudonimizar

El dato se sustituye, pero se puede deshacer

María PérezInteresado 1tabla de equivalencias

Sigue siendo dato personal. La reidentificación es posible, así que el documento continúa dentro del ámbito del RGPD.

Anonimizar

El dato desaparece del archivo

María Pérezsin dato

Deja de ser dato personal. Sin forma de recuperarlo, el documento sale del ámbito del RGPD. Es lo que hace Redactor.

Redactor hace lo segundo: el dato desaparece del archivo. Y esto conecta con el error más repetido en las anonimizaciones manuales, que es dibujar un rectángulo negro encima del texto en el visor de PDF. Visualmente parece tapado, pero el texto sigue en el archivo: se recupera seleccionándolo y copiándolo, o abriendo el PDF con cualquier extractor. Documentos publicados por organismos públicos han filtrado datos exactamente así.

A mano, con buscar y reemplazar, o con Redactor

 A manoBuscar y reemplazarRelevX Redactor
Tiempo por documento~20 min~8 min2-3 s
Detecta variantes del mismo nombreNo
Encuentra datos que no sabías que estabanA vecesNo
Elimina el dato del archivoSegún cómo se haga
Deja registro de lo anonimizadoNoNo
Constante a las 300 páginasNo
Procesa lotes de documentosNoNo

Los tiempos a mano y con buscar y reemplazar son los medidos en el proyecto del Ajuntament de Santa Coloma de Gramenet sobre sus propios documentos.

Preguntas frecuentes

Lo que nos preguntan sobre Redactor

Sí. El problema es el mismo en despachos de abogados que anonimizan sentencias para publicarlas o compartirlas, en clínicas que ceden historiales para estudios, y en cualquier organización que tenga que entregar documentación a un tercero sin los datos personales dentro. Lo que cambia entre sectores son los campos a detectar y el formato de los documentos, y eso se ajusta.
No, y desconfía de quien te diga lo contrario. Ningún sistema automático lo es, igual que tampoco lo es una persona revisando treinta páginas a las siete de la tarde. Por eso el diseño incluye el paso de revisión: la aplicación separa lo que ha detectado con certeza de lo que no, y lo dudoso lo decide una persona. Eso reduce el tiempo drásticamente sin quitar el control de encima.
Mejora. El sistema tiene memoria: cuando validas una entidad o añades algo que no había detectado, esa corrección se conserva y se aplica a los documentos siguientes. Los primeros archivos de una organización piden más revisión, porque todavía no conoce vuestros formatos ni vuestra forma de redactar; con el uso, la lista de dudas se acorta sola.
No. Es un error habitual en anonimizaciones hechas a mano: se dibuja un rectángulo negro encima del texto, pero el texto sigue debajo y se recupera copiándolo o abriendo el archivo con otra herramienta. Aquí el dato se elimina del documento, no se cubre.
La base ya está construida. Lo que lleva tiempo es adaptarla a tus documentos: qué campos hay que detectar, cómo están redactados y en qué formato salen. Con una muestra de tus documentos reales podemos decirte un plazo concreto en el diagnóstico gratuito.

Míralo funcionando con tus documentos

La forma más rápida de saber si te sirve es verlo con un documento tuyo. Reserva una demo y lo probamos sobre tu caso.

Redactor tiene web propia en redactor.relevx.com, disponible también en catalán e inglés.

Escríbenos por WhatsApp