Un día buscas tu marca en Google y todo parece estar bien. Luego le preguntas a ChatGPT y recibes una respuesta en parte errónea, en parte desactualizada y en parte basada en contenido que nunca aceptaste compartir. Ahora quieres eliminar tus datos de la IA, y el RGPD es tu primera herramienta. O al menos quieres que los corrijan.
Bienvenido a uno de los cruces más caóticos de la tecnología actual: tus datos, los modelos de IA y las leyes que supuestamente te protegen.
Qué dice realmente el RGPD sobre los datos de entrenamiento de la IA
El artículo 17 del RGPD, el "derecho de supresión" o "derecho al olvido", da a los residentes en la UE el derecho a solicitar la eliminación de sus datos personales. El artículo 16 regula el derecho de rectificación de los datos inexactos. Ambos se aplican a las empresas de IA que tratan datos personales de residentes en la UE.
El problema es práctico, no legal. Cuando tus datos se usan para entrenar un gran modelo de lenguaje, no quedan en una fila de una base de datos que se pueda borrar. Están integrados en miles de millones de parámetros del modelo. "Borrarlos" de un modelo ya entrenado es técnicamente distinto de eliminar un registro de una base de datos tradicional, y el sector todavía está definiendo cómo es realmente el cumplimiento.
Aun así, la obligación legal existe. Las empresas de IA deben responder a las solicitudes basadas en el RGPD, y los reguladores de toda Europa han dejado claro que se lo toman en serio. Italia prohibió temporalmente ChatGPT en 2023 por motivos relacionados con el RGPD. La CNIL francesa ha publicado directrices específicas sobre IA y datos personales.
Cómo solicitar la eliminación, empresa por empresa
Cada gran empresa de IA tiene su propio proceso. Este es el estado actual.
OpenAI (ChatGPT, DALL-E, API de GPT)
Envía tus solicitudes a través de privacy.openai.com. Puedes pedir acceso a tus datos, la eliminación de los datos de tu cuenta y la corrección de respuestas inexactas. OpenAI también permite desactivar en la configuración de la cuenta el uso de tus conversaciones para entrenar. Si tienes una web, bloquear GPTBot en el robots.txt evita el rastreo futuro.
Google (datos de entrenamiento de Gemini)
Las herramientas de privacidad de Google en myaccount.google.com gestionan las solicitudes de eliminación de los datos de conversaciones con Gemini. Para evitar que tu web se use para entrenar IA, bloquea el user agent Google-Extended en el robots.txt. Es independiente de Googlebot, que se encarga de la indexación normal de la búsqueda.
Meta (modelos LLaMA)
Meta acepta solicitudes de eliminación de datos a través de su portal de privacidad estándar. Para el contenido de Facebook e Instagram, puedes oponerte al uso de tus datos para entrenar IA desde la configuración de la plataforma. Meta publicó su documentación de cumplimiento del RGPD para el entrenamiento de LLaMA en 2024, tras la presión de los reguladores europeos.
Stability AI (Stable Diffusion)
Para imágenes, usa haveibeentrained.com para comprobar si tus imágenes aparecen en el conjunto de datos LAION-5B usado para entrenar Stable Diffusion. El registro Do Not Train de Spawning AI te permite excluirte formalmente. Stability AI se ha comprometido a respetar estas exclusiones en futuras versiones de sus modelos.
Mecanismos de exclusión preventiva
Solicitar la eliminación a posteriori es un enfoque. Evitar la inclusión desde el principio es otro.
robots.txt sigue siendo el mecanismo más universal. Añade directivas específicas para los crawlers de IA:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
Esto bloquea el rastreo futuro, pero no afecta a los datos ya recogidos.
ai.txt es un protocolo de Spawning AI que ofrece un control más fino que el robots.txt. Te permite definir permisos distintos para distintos usos de la IA (entrenamiento, inferencia, indexación).
Los controles a nivel de plataforma en sitios como DeviantArt, ArtStation y otros permiten a los creadores marcar obras concretas como no disponibles para entrenar IA. Varían según la plataforma.
La reserva de TDM (minería de textos y datos) de la normativa europea de derechos de autor permite a los titulares de derechos reservarse expresamente sus derechos frente a la minería de textos y datos, incluido el entrenamiento de IA. Es jurídicamente vinculante en la UE desde la Directiva DSM.
La Ley de IA de la UE añade una nueva capa
La Ley de IA de la UE, cuyas disposiciones entran en vigor de forma escalonada entre 2025 y 2026, añade obligaciones para los proveedores de modelos de IA de uso general:
- Publicar resúmenes suficientemente detallados de los datos de entrenamiento
- Cumplir la normativa europea de derechos de autor, incluidas las exclusiones de TDM
- Aplicar medidas técnicas para respetar el robots.txt y señales similares
Esto no te da un botón mágico de "borrar mis datos", pero aumenta la transparencia y refuerza la base legal de los mecanismos de exclusión.
Eliminación de datos vs monitorización de la visibilidad: dos problemas distintos
Aquí es donde la mayoría de las marcas se confunde. Mezclan dos asuntos distintos.
La eliminación de datos trata de propiedad intelectual y privacidad. ¿Usó una empresa de IA tu contenido para entrenar su modelo sin permiso? Esto importa a creadores, editores y cualquiera que produzca contenido original.
La visibilidad en IA trata de resultados de negocio. Cuando un cliente potencial le pregunta a ChatGPT "¿cuál es la mejor herramienta para [tu categoría]?", ¿aparece tu marca en la respuesta? Esto importa a cualquier negocio que consiga clientes a través de la búsqueda.
Estos dos asuntos pueden incluso tirar en direcciones opuestas. Bloquear todos los crawlers de IA protege tu contenido del rastreo, pero también puede reducir las señales que ayudan a las plataformas de IA a recomendarte. Una marca que se excluye de todo de forma agresiva puede proteger su propiedad intelectual y, al mismo tiempo, volverse invisible en el descubrimiento impulsado por la IA.
El enfoque pragmático para la mayoría de los negocios: usar el robots.txt de forma selectiva (bloquear los crawlers de entrenamiento y, siempre que se pueda, no los que sirven para generar respuestas), monitorizar activamente tu visibilidad en IA y presentar solicitudes de rectificación cuando las plataformas de IA muestren información inexacta sobre ti.
Lo que de verdad marca la diferencia
Si tu objetivo es que la IA te represente con precisión y tener una buena visibilidad en IA, las solicitudes de eliminación son un recurso de último caso, no una estrategia. La estrategia es:
- Haz que la información correcta sea fácil de encontrar. Páginas "Quiénes somos" claras, datos estructurados, información de producto actualizada.
- Construye señales de terceros. Reseñas en G2 y Trustpilot, menciones en Reddit, cobertura en publicaciones del sector.
- Monitoriza de forma continua. Sigue a diario lo que dicen de ti las plataformas de IA, no una vez por trimestre. Herramientas como Mentionable lo automatizan en ChatGPT, Claude, Perplexity, Gemini, Copilot, Google AI Mode y Google AI Overview.
- Corrige cuando haga falta. Presenta solicitudes de rectificación ante errores de hecho. Optimiza tu contenido para dar mejores señales.
El RGPD te da derechos. Úsalos cuando los necesites. Pero no confundas la eliminación defensiva de datos con una estrategia de crecimiento. Las marcas que ganan en visibilidad en IA son las que moldean activamente cómo las representa la IA, no las que solo intentan sacar sus datos de la máquina.
