---
title: "Anonimizador de datos con Claude Code: Protege tu información antes de procesarla con IA"
description: "Compartir datos con herramientas de IA sin anonimización es una práctica de alto riesgo. Las filtraciones de datos globales aumentaron un 68% en 2023 por errores humanos y ataques de ingeniería social, según el Verizon Data Breach Investigations Report 2024."
url: https://zythos.media/anonimizador-de-datos-para-claude-code-protege-tu-informacion-antes-de-procesarla-con-ia/
date: 2026-06-22
modified: 2026-07-18
author: "Carlos Uhart"
image: https://zythos.media/wp-content/uploads/2026/06/Anonimizacion-de-datos-1.jpg
categories: ["Blog"]
type: post
lang: es
---

# Anonimizador de datos con Claude Code: Protege tu información antes de procesarla con IA

El uso de inteligencia artificial generativa sobre datos de clientes plantea un dilema de seguridad y es que las herramientas como ChatGPT, Perplexity o Gemini son poderosas, pero enviarles información personal identificable (PII) sin protección viola normativas de privacidad en decenas de países. La solución no es renunciar a la IA, sino anonimizar los datos antes de que salgan de tu máquina.

El anonimizador multijurisdiccional que hemos desarrollado resuelve este problema con un enfoque técnico robusto, que procesa archivos CSV, Excel, Word y Markdown de forma local, reemplazando nombres, correos, números de identificación y teléfonos con tokens neutrales.

El archivo tokenizado puede entregarse a cualquier asistente de IA sin que los datos reales abandonen tu control. Una vez obtenida la respuesta, un único comando restaura los valores originales.

La clave está en el flujo.

Anonimizar → procesar con IA → restaurar.

El modelo de IA solo ve <PERSONA-1>, <EMAIL-1>, <DNI-ES-1>; nunca el dato real. El mapa de tokens queda almacenado localmente en un archivo .key.json que puede cifrarse opcionalmente.

## ¿Qué es un anonimizador de datos personales y por qué lo necesitas?

Compartir datos con herramientas de IA sin anonimización es una práctica de alto riesgo. Las filtraciones de datos globales aumentaron un 68% en 2023 por errores humanos y ataques de ingeniería social, según el Verizon Data Breach Investigations Report 2024.

Las agencias de SEO, consultores y analistas de datos que manejan información de clientes se enfrentan a un escenario complejo, ya que necesitan la potencia de la IA, pero no pueden exponer PII.

### 1. El problema de compartir datos sensibles con IA

Cada vez que subes un archivo con nombres, RUT, CPF o correos a un modelo en la nube, esos datos viajan a servidores fuera de tu control.

El RGPD, la [Ley 21.719](https://zythos.media/ley-de-proteccion-de-datos-en-chile-esta-tu-sitio-web-preparado-para-cumplir/) chilena, la LGPD brasileña o la CCPA californiana establecen sanciones millonarias por el tratamiento indebido de datos personales.

En Chile, la nueva Ley 21.719 prevé multas de hasta 20.000 UTM (aproximadamente 1,6–2 millones de dólares) para infracciones muy graves.

El problema se agrava cuando trabajas con múltiples jurisdicciones. Un mismo dataset puede contener ciudadanos de Chile, España, Brasil y México. Cada país exige un estándar de protección diferente.

### 2. Anonimización local con reversibilidad

El anonimizador multijurisdiccional opera con un principio fundamental, el procesamiento de identificación de entidades ocurre completamente en tu máquina.

Utiliza spaCy para el análisis lingüístico y Microsoft Presidio para la detección de PII mediante expresiones regulares y reglas deterministas. Ningún dato sale del equipo durante la fase de anonimización.

La reversibilidad es otro pilar. A diferencia de las técnicas de hash irreversibles, este sistema genera un mapa de tokens que permite restaurar los datos originales tras el procesamiento con IA.

Esto es crucial para flujos de trabajo que requieren mantener la integridad de los datos, como informes de auditoría o análisis de clientes.

## Arquitectura técnica del anonimizador

El sistema se estructura en tres componentes principales.

1. El motor de detección de entidades
2. El motor de tokenización
3. El motor de restauración

### 1. Motor NLP: spaCy + Microsoft Presidio

La detección de PII combina dos tecnologías de referencia. Presidio, desarrollado por Microsoft, proporciona reconocedores predefinidos para patrones comunes como correos electrónicos, números de teléfono, IBAN y tarjetas de crédito.

spaCy añade la capacidad de reconocimiento de entidades nombradas (NER) para identificar nombres de personas, ubicaciones y fechas en lenguaje natural.

El script carga los modelos lingüísticos necesarios según la jurisdicción seleccionada. Para español, utiliza es_core_news_lg; para portugués, pt_core_news_lg; para inglés, en_core_web_lg. Esta arquitectura modular permite ejecutar el anonimizador con los idiomas que realmente necesites, reduciendo el tiempo de inicio.

### 2. Anonimizar → procesar con IA → restaurar

El ciclo de vida del dato es sencillo y seguro:

1. **Anonimización:** El script procesa el archivo de entrada celda por celda, párrafo por párrafo. Cada valor identificado como PII se reemplaza por un token numerado (<PERSONA-1>, <EMAIL-1>, <RUT-CL-1>). El mismo valor siempre recibe el mismo token dentro del archivo.
2. **Procesamiento con IA:** El archivo tokenizado se entrega a ChatGPT, Claude o cualquier herramienta de IA. El modelo trabaja con normalidad, pero solo ve tokens. Los datos reales nunca llegan a la nube.
3. **Restauración:** Con el archivo procesado por la IA y el mapa de tokens original, un único comando restaura todos los valores reales. El sistema localiza automáticamente el mapa .key.json correspondiente.

### 3. Formatos soportados

El anonimizador maneja cuatro formatos de archivo:

- **CSV: **Procesa todas las celdas. Detecta automáticamente exportaciones de Screaming Frog y solo procesa columnas de texto libre.
- **XLSX: **Itera sobre todas las hojas y celdas.
- **DOCX: **Procesa el cuerpo, tablas, encabezados, pies de página y cuadros de texto. Conserva el formato (negritas, cursivas). Notas al pie, comentarios y notas finales no se procesan aún.
- **Markdown: **Analiza línea por línea preservando el formato.

## Cobertura regulatoria con 8 jurisdicciones en un solo script

El anonimizador soporta ocho marcos legales con sus identificadores específicos. Cada jurisdicción añade reconocedores personalizados para los documentos de identidad nacionales.

### 1. RGPD (UE) y UK GDPR

Para la UE y Reino Unido, el sistema detecta DNI/NIE español (12345678Z, X1234567Z), números de la Seguridad Social del Reino Unido (NINO) y teléfonos con prefijo +34 o +44. El UK GDPR incorpora las modificaciones del Data (Use and Access) Act 2025, que introduce divergencias con el RGPD europeo en aspectos como el consentimiento para cookies de análisis.

### 2. Ley 21.719 (Chile)

La nueva ley chilena, publicada en diciembre de 2024, entra en vigor el 1 de diciembre de 2026 y deroga completamente la Ley 19.628. Crea la Agencia de Protección de Datos Personales (APDP) como autoridad autónoma con facultades sancionadoras. El anonimizador detecta RUT/RUN con y sin puntos (12.345.678-9 o 12345678-K), teléfonos chilenos con prefijo +56 y móviles de 9 dígitos.

### 3. LGPD (Brasil), LFPDPPP (México), Ley 1581 (Colombia), Ley 25.326 (Argentina)

- **Brasil (LGPD): **Detecta CPF (123.456.789-09) y CNPJ (12.345.678/0001-95).
- **México (LFPDPPP):** Detecta CURP (18 caracteres alfanuméricos) y RFC (13 o 12 caracteres). La reforma de noviembre de 2024 eliminó el INAI y designó a la SABG como nueva autoridad.
- **Colombia (Ley 1581):** Detecta NIT (123456789-1) y CC (cédula de ciudadanía) solo cuando va precedida de C.C., cédula o documento para evitar falsos positivos.
- **Argentina (Ley 25.326): **Detecta DNI con puntos (12.345.678) y CUIT/CUIL (20-12345678-9). El DNI sin puntos tiene una confianza baja (0.55) por el alto riesgo de falsos positivos.

### 4. CCPA/CPRA (California)

Detecta números de la Seguridad Social de EE. UU. (123-45-6789) y licencias de conducir de California (formato A1234567). Las nuevas regulaciones de la CPPA, en vigor desde enero de 2026, incluyen datos neuronales como información sensible y clasifican automáticamente como sensible los datos de menores de 16 años.

## Instalación y uso práctico

La instalación es directa para equipos con conocimientos técnicos medios.

### 1. Requisitos y dependencias

git clone –depth 1 https://github.com/uhartharper/anonimizador-datos.git cd anonimizador-datos pip install -r requirements.txt python -m spacy download es_core_news_lg

Para cobertura completa:

python -m spacy download en_core_web_lg python -m spacy download pt_core_news_lg

### 2. Integración con Claude mediante skill

El repositorio incluye un archivo SKILL.md que permite invocar el anonimizador directamente desde Claude con comandos en lenguaje natural:

/anonimizar contactos.csv → anonimiza con todas las jurisdicciones

/anonimizar informe.docx para rgpd → anonimiza solo para RGPD

/anonimizar restaurar contactos_anon.csv → restaura el archivo

## Seguridad de los datos con cifrado del mapa de tokens

El archivo .key.json contiene los datos originales en texto plano. Su protección es tan crítica como la del archivo fuente.

### El archivo .key.json y su protección

Este archivo JSON almacena el mapa de tokens con la estructura:

{ «version»: «2.2», «ley»: [«rgpd»], «fecha»: «2026-06-21T10:00:00+00:00», «archivo_origen»: «original.csv», «mapa»: { «<PERSONA-1>»: «Juan García», «<EMAIL-1>»: «juan@mail.com» } }

El sistema escribe automáticamente un <>.gitignore</> en la carpeta de salida para evitar el commit accidental de estos archivos y advierte si el mapa se almacena en carpetas sincronizadas con la nube (OneDrive, Dropbox, Google Drive, iCloud).

### Cifrado AES con Fernet y PBKDF2

Para proteger el mapa, el anonimizador ofrece cifrado AES mediante Fernet, con derivación de clave PBKDF2-SHA256:

export ANON_CLAVE=»mi-clave-secreta» python anonimizar.py datos.csv –ley rgpd –cifrar-mapa python anonimizar.py datos_anon.csv –restaurar

El cifrado es opcional y nunca bloquea la ejecución en entornos no interactivos, lo que lo hace seguro para scripts automatizados.

### Informes de cobertura tras cada ejecución

Tras cada ejecución, el sistema imprime:

- Tras anonimizar, desglose de los tipos de PII detectados y conteos, más una advertencia si el texto fuente ya contenía tokens.
- Tras restaurar, lista de tokens del mapa que no aparecieron en el archivo (porque la IA los alteró) y tokens residuales sin entrada en el mapa.

## Limitaciones conocidas y consideraciones prácticas

Ninguna herramienta de anonimización es perfecta. Conocer las limitaciones evita sorpresas.

### Falsos positivos en NER y cómo mitigarlos

spaCy puede etiquetar palabras comunes en español (saludos, títulos) como nombres de personas. El script filtra las más frecuentes, pero pueden quedar residuos.

Para datos con muchos códigos numéricos (SKU, IDs de pedido), el uso de –ley todo activa reconocedores de baja confianza que generan falsos positivos. La recomendación es acotar la jurisdicción con –ley <jurisdicción>.

### Detección contextual de ubicaciones

Las ubicaciones solo se anonimizan cuando hay un nombre de persona cerca (~120 caracteres en el mismo párrafo). En tablas, el contexto es la fila completa.

Si ninguna celda contiene un nombre, las ubicaciones no se tocan, evitando la anonimización de ciudades en listados de productos. En exportaciones de Screaming Frog, el tratamiento es por celda.

### Fidelidad en la restauración

Si la IA elimina o altera un token, ese valor no puede restaurarse. El resultado es el archivo procesado con los valores reales reinsertados, que puede no ser idéntico al original byte a byte.

Si el mismo valor aparece con diferentes mayúsculas/minúsculas, cada variante se almacena como un token independiente.

Un estudio publicado en *Scientific Data* comparó herramientas de anonimización para datos de salud y concluyó que los métodos de anonimización como ARX y SynDiffix preservan mejor la utilidad analítica que la síntesis de datos con redes generativas.

El enfoque de tokenización reversible utilizado por este anonimizador ofrece una ventaja adicional, que es la capacidad de recuperar los datos originales sin pérdida de información.

## Preguntas frecuentes

### 1. ¿Qué diferencia a este anonimizador de Microsoft Presidio por sí solo?

Presidio es una biblioteca de detección de PII. Este anonimizador añade una capa de tokenización reversible, soporte multijurisdiccional, procesamiento de múltiples formatos de archivo (CSV, Excel, Word, Markdown) y un flujo de trabajo completo de anonimización-restauración pensado para integración con asistentes de IA.

### 2. ¿Puedo usar el anonimizador sin conexión a internet?

Sí. La detección de PII mediante spaCy y Presidio funciona completamente offline. No se requiere conexión a la nube para anonimizar ni restaurar. Solo necesitas descargar los modelos lingüísticos durante la instalación.

### 3. ¿Qué ocurre si pierdo el archivo .key.json?

Sin el mapa de tokens, la restauración es imposible. El sistema no puede adivinar los valores originales. Protege este archivo con los mismos controles de acceso que el archivo fuente.

### 4. ¿El anonimizador funciona con documentos escaneados en PDF?

No. El sistema procesa archivos de texto estático. No realiza OCR ni extrae texto de imágenes. Para PDF, necesita que el texto sea seleccionable.

### 5. ¿Cómo maneja el anonimizador datos mixtos de múltiples jurisdicciones?

El parámetro <>–ley todo</> activa todos los reconocedores simultáneamente. El sistema detecta automáticamente qué identificadores corresponden a cada país. Para reducir falsos positivos, puedes especificar las jurisdicciones relevantes.

### 6. ¿Puedo anonimizar carpetas completas?

Sí. python anonimizar.py C:/carpeta/ procesa todos los archivos soportados en el primer nivel de la carpeta.

### 7. ¿Qué pruebas de regresión incluye?

El repositorio incluye test_anonimizar.py con pruebas para cada jurisdicción, verificando que los identificadores se tokenizan correctamente y que el ciclo anonimización-restauración es completo.

## Automatiza la protección de datos sin renunciar a la IA

El anonimizador multijurisdiccional resuelve un problema real con una solución técnica sólida. Permite a agencias SEO, consultores y equipos de datos aprovechar toda la potencia de la IA generativa sin exponer información personal identificable a terceros.

La combinación de spaCy y Presidio proporciona una detección precisa, la tokenización reversible mantiene la integridad de los datos, y la cobertura de ocho jurisdicciones asegura el cumplimiento normativo en los mercados hispanohablantes y más allá.

La fecha límite para la Ley 21.719 en Chile es diciembre de 2026. Los equipos que manejen datos de ciudadanos chilenos deben implementar mecanismos de anonimización antes de esa fecha para evitar sanciones que pueden alcanzar las 20.000 UTM por infracción. Este anonimizador ofrece una vía práctica y auditada para cumplir con ese requisito.

Clona el repositorio, instala las dependencias y prueba el flujo completo con un archivo de muestra. El script test_anonimizar.py te dará una verificación rápida de que todo funciona correctamente. La protección de datos no tiene por qué ser un obstáculo para la innovación; con las herramientas adecuadas, ambas pueden avanzar juntas.

## Contáctanos y solicita tu evaluación gratuita

Por favor, activa JavaScript en tu navegador para completar este formulario.Por favor, activa JavaScript en tu navegador para completar este formulario.Nombre *NombreApellidosCorreo electrónico *Teléfono
servicios o Comentario

Seleccionar servicios

- Auditoría SEO & IA Search
- Redacción de contenidos
- Mantenimiento WordPress
- Artículos patrocinados
- Implementar Cloudflare
- Diseño web WordPress

Sitio web (opcional)Comentario o mensaje
Quiero mi propuesta![Cargando](https://zythos.media/wp-content/plugins/wpforms/assets/images/submit-spin.svg)
