Inteligencia Artificial

Claude marca el contenido que genera: watermark en texto y C2PA en archivos

Autorangel cruz
Actualizado
Publicado
Lectura21 min de lectura
Claude marca el contenido que genera: watermark en texto y C2PA en archivos

Desde el 2 de agosto de 2026, el texto que genera Claude lleva una marca de agua invisible y los archivos que produce llevan metadatos de procedencia firmados. Anthropic lo publicó en su centro de ayuda, y no es una decisión de producto aislada: es la consecuencia directa de haber firmado el Código de Buenas Prácticas sobre Transparencia del Contenido Generado por IA, el instrumento que la Comisión Europea creó para aterrizar el artículo 50 del Reglamento de IA.

Lo interesante para quien desarrolla no es la noticia en sí, sino lo que implica: si tu producto genera texto con la API de Claude, ese texto sale marcado, y las obligaciones de transparencia que quedan encima de ese texto son tuyas, no de Anthropic.

Vamos por partes.

Qué firmó Anthropic exactamente

El Reglamento de IA europeo (el AI Act) tiene un artículo, el 50, dedicado a transparencia. La Comisión publicó el 10 de junio de 2026 un Código de Buenas Prácticas voluntario para ayudar a cumplirlo, y el 8 y 9 de julio la propia Comisión y el Consejo de IA lo declararon "adecuado". Eso lo convierte, hoy por hoy, en la única herramienta práctica de cumplimiento validada a nivel europeo para estas obligaciones.

El Código tiene dos secciones que se firman por separado:

  • Sección 1, para proveedores de sistemas de IA generativa: marcado legible por máquina, mecanismos de detección, calidad de esas medidas y documentación.
  • Sección 2, para quienes despliegan esos sistemas: etiquetado visible de deepfakes y de texto publicado sobre asuntos de interés público.

El 31 de julio de 2026 la Comisión publicó la lista: unas 190 organizaciones, 82 en la Sección 1 y 152 en la Sección 2. Entre las de Sección 1 están Anthropic, Google, OpenAI, Meta, Microsoft, Mistral, Cohere, Aleph Alpha, Black Forest Labs y Synthesia. En la Sección 2 aparecen nombres que no son empresas de IA: Getty Images, Lenovo, Lufthansa, Iberdrola, Bulgari. Aproximadamente la mitad de los firmantes son compañías pequeñas y recientes.

Anthropic firmó como proveedor de modelos y de sistemas de IA generativa. De ahí sale todo lo demás.

Qué exige el artículo 50 (y qué no)

Conviene separar dos párrafos que la gente mezcla constantemente.

Artículo 50(2), obligación del proveedor. Las salidas sintéticas de audio, imagen, vídeo o texto deben marcarse "en un formato legible por máquina" y ser detectables como generadas o manipuladas artificialmente. La norma admite matices por viabilidad técnica, tipo de contenido, coste y estándares del sector. Hay excepciones: funciones de asistencia a la edición, sistemas que no alteran sustancialmente los datos de entrada, y ciertos usos policiales. Las Directrices también dejan fuera cosas como el código fuente, secuencias cortas de símbolos y las salidas máquina a máquina que ningún humano ve.

Artículo 50(4), obligación de quien despliega. Aquí ya no hablamos de marcas invisibles sino de etiquetas visibles. Si publicas deepfakes, hay que revelarlo. Si publicas texto generado por IA para informar al público sobre asuntos de interés público, hay que revelarlo también. Y aquí está la excepción que a mucha gente le cambia la vida: no aplica cuando el contenido pasó por revisión humana o control editorial y alguien asume la responsabilidad editorial.

El detalle de calendario: la aplicación general es el 2 de agosto de 2026, con un periodo transitorio hasta el 2 de diciembre de 2026 para sistemas ya en el mercado antes de esa fecha, y sin retroactividad para el contenido generado antes. Las sanciones llegan a 15 millones de euros o el 3% de la facturación mundial.

Un punto que el propio Código reconoce, y que se agradece: ninguna técnica de marcado cumple hoy sola los cuatro requisitos del 50(2) (eficacia, interoperabilidad, robustez y fiabilidad). Por eso la recomendación es apilar técnicas: metadatos, marca de agua y procedencia.

Eso es justo lo que hace Anthropic.

Las dos marcas que pone Claude

1. Marca de agua incrustada en el texto

Cuando un modelo compatible genera texto, teje una señal imperceptible dentro del propio texto. No la ves, no cambia el significado, no cambia la calidad ni la legibilidad.

La parte importante desde el punto de vista técnico: la marca vive dentro del texto, no en los metadatos. Viaja con el copiar y pegar, y puede sobrevivir a cierta edición. Y como se aplica a nivel de modelo, da igual por qué superficie salga: la API, la app, Claude Code, Claude Cowork o Claude Tag.

Cómo funciona por dentro

Actualización del 14 de agosto de 2026. Cuando se publicó este artículo, Anthropic no había explicado su método y aquí se citaba SynthID-Text como contexto del estado del arte, con la advertencia de que no era una descripción de Claude. Ya lo confirmaron: es una versión de SynthID-Text, así que lo que sigue deja de ser hipótesis.

La marca es una versión del enfoque SynthID-Text de Google DeepMind, publicado en Nature en 2024. La familia de técnicas se remonta a una propuesta de Scott Aaronson de 2022, y todas comparten el mismo principio: la marca solo cambia de dónde sale el azar con el que se elige cada palabra. No cambia el contenido.

Un modelo genera palabra a palabra, y en cada paso tiene varias candidatas razonables. En "El clima de hoy estaba frío y…", lo siguiente difícilmente será "azucarado", pero puede ser "nublado" o "gris" sin que al lector le cambie nada. Esa elección se resuelve normalmente con un número aleatorio.

El marcado se mete justo ahí. En vez de tirar de un generador aleatorio cualquiera, usa la clave y unas cuantas palabras anteriores para decidir cuál de las candidatas equivalentes toca. Las palabras siguen siendo, a efectos prácticos, aleatorias, pero quien tenga la clave puede recorrer la secuencia y comprobar si encaja con las elecciones que habría hecho Claude usándola. Si encajan, se le asigna una probabilidad.

Conviene entender lo que no implica. No sesga al modelo hacia palabras raras: no le va a hacer escribir "nubiloso" en vez de "nublado". Y no fija una preferencia estable por "gris" sobre "nublado", porque la elección depende del texto que viene antes, así que cambia en cada frase.

De ahí salen cuatro consecuencias prácticas que la nota deja por escrito:

  • No se añade nada al texto. No hay caracteres ocultos ni invisibles.
  • No consume tokens extra ni cuesta más.
  • No lleva información identificativa. No se puede rastrear hasta una persona, una organización ni una conversación concreta. Solo responde a "¿esto lo escribió Claude?", nunca a "¿quién?".
  • No cambia quién es dueño de la salida ni quién responde legalmente por ella.

Sobre si degrada la calidad, hay una medición y no solo una promesa: en el propio paper de SynthID-Text, DeepMind sirvió el modelo marcado a una parte del tráfico real de Gemini y comparó los votos de pulgar arriba y abajo, sin diferencias estadísticamente significativas. En un estudio controlado, evaluadores humanos comparando respuestas marcadas y sin marcar lado a lado tampoco vieron diferencia.

2. Metadatos de procedencia firmados

Para archivos (.svg, .png, .jpg según la documentación actual), Claude adjunta metadatos de procedencia firmados criptográficamente siguiendo el estándar C2PA, de la Coalition for Content Provenance and Authenticity. Es el mismo estándar que están adoptando Adobe, Google, Microsoft y buena parte de la industria de cámaras y edición.

Un manifiesto C2PA firmado te dice dos cosas: que el archivo pasó por Claude, y si el archivo fue manipulado después. Lo segundo es lo que aporta valor real, porque la firma se rompe si alguien toca el contenido.

Su punto débil es conocido y no es culpa de nadie: los metadatos se pierden con facilidad. Una conversión de formato, un reguardado, una captura de pantalla o casi cualquier subida a una red social que reescriba el archivo se los lleva por delante. Por eso el marcado en el propio contenido y el marcado en metadatos son complementarios, no alternativos.

Dónde aplica

Vale la pena leer el alcance con calma, porque es más amplio de lo que la gente asume:

Dimensión Alcance
Modelos Los lanzados desde el 2 de agosto de 2026 marcan desde el día uno. Para los anteriores, hay periodo transitorio y trabajo en curso
Productos API, Claude, Claude Code, Claude Cowork, Claude Tag
Nubes Watermark de texto también vía AWS, Google Cloud y Microsoft Foundry. Los metadatos C2PA firmados dependen de lo que soporte cada plataforma
Regiones En todo el mundo, no solo en la UE

Ese último punto es el que más se comenta, y ahora hay motivo oficial en lugar de deducción. Anthropic lo explica así: aplican el marcado globalmente porque todavía no tienen una forma duradera de acotarlo por región, y añaden que siguen evaluando otros enfoques. O sea, no es una decisión de principios sino una limitación técnica que podría cambiar. El efecto colateral es el mismo de siempre: una norma europea acaba definiendo el comportamiento del producto en todo el mundo, igual que pasó con el RGPD.

Los límites, dichos sin adornos

Anthropic es bastante honesta en su documentación, y esta parte es la que deberías leer dos veces antes de construir nada encima.

Que se detecte una marca no prueba autoría. Indica que el contenido pudo pasar por Claude. La gente usa estos modelos para corregir, traducir, resumir o convertir archivos: la salida puede llevar marca aunque las ideas y el texto original sean de un humano. Y el contenido puede haber cambiado después de que Claude lo tocara.

Que no se detecte marca no prueba nada tampoco. Los casos que la propia Anthropic enumera: modelos anteriores al soporte de marcado, texto muy editado o parafraseado, fragmentos demasiado cortos para dar señal fiable, metadatos eliminados por conversión o captura, o plataformas y tipos de archivo donde el marcado no aplica.

Y hay un límite estructural que no depende de nadie: el marcado necesita que el modelo tenga dónde elegir. Es la consecuencia directa de cómo funciona, y la nota del 14 de agosto lo detalla con ejemplos:

  • En pasajes factuales la señal es más pobre. En "la obra más famosa de Isaac Newton se llamaba…" solo hay una continuación correcta. Si el modelo no puede elegir sin equivocarse, el marcado no tiene material sobre el que actuar.
  • La corrección de estilo casi no marca. Si le pasas un texto tuyo y le pides que solo arregle gramática y puntuación, la marca únicamente puede vivir en ese puñado de correcciones, que pueden ser demasiado pocas para registrarse.
  • Los fragmentos cortos son poco fiables, por lo mismo: menos elecciones, menos información. La confianza sube con la longitud del pasaje.
  • Las traducciones sí llevan marca, porque ahí cada palabra la elige Claude.

Léelo al revés y tienes el mapa de cuándo esto sirve: funciona mejor cuanto más generativo y más largo es el texto, y peor cuanto más factual, más corto o más asistido sobre algo que ya escribiste tú. Que es, incómodamente, justo al revés de lo que le interesaría a quien quiere cazar a un estudiante copiando una definición.

A eso hay que sumarle lo que dice la literatura académica, que es menos diplomática. Los ataques de eliminación de marcas de agua en texto son un campo activo: edición de tokens, sustitución por sinónimos y parafraseo dirigido. Hay trabajos recientes, como el Self-Information Rewrite Attack, que en lugar de pedirle a un modelo "reescribe esto" (lento y poco fiable) calculan la autoinformación de cada token para localizar exactamente dónde es probable que viva la señal y atacar ahí. Existe además un compromiso estructural documentado: contextos más grandes dan mejor calidad de texto pero son más vulnerables al parafraseo, y contextos pequeños son más robustos pero degradan la calidad.

Traducción práctica: esto sirve como señal de procedencia, no como prueba forense. Cualquiera que te venda un detector de IA con veredicto binario, con o sin watermark de por medio, te está vendiendo algo que la tecnología no da.

Anthropic lo acota igual de claro: con su clave solo se puede responder "¿qué probabilidad hay de que esto lo escribiera Claude, en parte?". No confirma que un texto sea humano, y no sirve para saber si lo escribió otra IA, porque otro proveedor tendría otra clave y podría usar hasta otro método distinto.

Esto no es lo mismo que un detector de IA

Vale la pena separarlo, porque se confunde constantemente. Los detectores tipo Pangram no tienen la clave de Anthropic, así que hacen algo completamente distinto: buscan los tics del texto generado. La propia nota da dos ejemplos que se leen con una sonrisa incómoda, porque los reconocerás: la construcción "esto no es X, es Y" y el abuso de la palabra "quietly".

Eso es análisis estilístico y es probabilístico por naturaleza, con falsos positivos contra cualquiera que escriba de forma parecida. Comprobar una marca de agua es otra cosa: verificar una firma matemática contra una clave. Son herramientas distintas para preguntas distintas, y ninguna de las dos da un veredicto binario fiable.

La API de detección todavía no existe

Cuando escribí este artículo, la documentación hablaba de una guía técnica "próximamente". La nota del 14 de agosto concreta un poco: habrá una API de detección de marca de agua, pero siguen "resolviendo los detalles de su implementación". Sin fecha.

Hasta que salga, no hay forma pública de comprobar una marca de Claude. Si tu producto depende de eso, sigue siendo un plan y no una función.

Qué te toca a ti si construyes con Claude

Aquí está la parte que la nota de Anthropic despacha en un párrafo y que a ti te puede costar dinero.

Si despliegas Claude dentro de tu producto, tus obligaciones del artículo 50 son tuyas. Anthropic cumple como proveedor del sistema generativo; tú puedes ser un deployer con obligaciones propias del 50(4), y en algunos montajes puedes ser tú mismo el proveedor del sistema que pones en el mercado.

Lo que yo revisaría, en este orden:

  1. ¿Tu app habla directamente con personas? Entonces el 50(1) pide que quede claro que están interactuando con una IA, salvo que sea obvio por el contexto.
  2. ¿Publicas texto generado por IA sobre asuntos de interés público? Ahí entra el 50(4). Si hay revisión humana con responsabilidad editorial asignada, la excepción aplica. Y "responsabilidad editorial asignada" significa que alguien concreto responde, no que alguien le echó un vistazo.
  3. ¿Generas o manipulas imagen, audio o vídeo de personas reales? Territorio deepfake, con obligación de revelarlo.
  4. ¿Tu pipeline conserva los metadatos? Si reprocesas imágenes con sharp, ImageMagick o cualquier optimizador, es muy probable que estés borrando el manifiesto C2PA sin querer. Si te importa la cadena de procedencia, hay que preservarla o volver a firmar.
  5. ¿Guardas trazabilidad propia? No dependas de la marca de agua para saber qué generó tu sistema. Un campo en base de datos con el modelo, la versión y el timestamp te da una respuesta que no depende de un detector externo.

Y una cosa que conviene decir: el marcado no aplica al código fuente. Si usas Claude Code para escribir software, lo que sale no lleva watermark porque el código está explícitamente fuera del alcance en las Directrices de la Comisión.

Y si escribes un blog, ¿qué te toca?

Esta parte va para quien no construye un producto con la API, solo publica artículos y usa asistentes de IA para trabajar. Que somos bastantes. No soy abogado, así que léelo como análisis de la norma, no como asesoría legal.

La marca de agua no es problema tuyo. Es obligación del proveedor. No tienes que preservarla, ni declararla, ni evitar borrarla. Si conviertes un archivo y se pierden los metadatos C2PA, no incumples nada: solo pierdes trazabilidad.

Lo que sí te llega es de otro tipo. El texto que publiques salido de Claude lleva una señal que, cuando Anthropic publique el detector, cualquiera podrá consultar. Y como ya vimos, esa señal aparece igual si solo pediste que te corrigieran un párrafo. Alguien puede usarla para acusarte de publicar IA. Tu defensa ahí no es técnica, es documental: si tu sitio vive en Git, tienes el historial de cada artículo con sus diffs y sus fechas. Eso vale más que cualquier detector.

Lo que sí te aplica es el 50(4). Si tu blog es actividad profesional (vendes servicios, tienes publicidad, es parte de tu trabajo) y tu audiencia está en la UE, eres deployer. Dos supuestos:

  1. Deepfakes: imagen, audio o vídeo generado o manipulado que parezca auténtico y represente personas, lugares o hechos reales. Una ilustración abstracta para tu Open Graph no lo es. Una foto realista de una persona real, sí.
  2. Texto generado por IA publicado para informar al público sobre asuntos de interés público. Un tutorial de Laravel difícilmente entra ahí (la norma apunta a noticias, política, salud, consumo), pero no hace falta ganar esa discusión, porque existe una salida limpia.

La excepción del control editorial. El 50(4) no aplica cuando el contenido pasó por revisión humana y hay responsabilidad editorial asignada. Si escribes, revisas, firmas con tu nombre y respondes por lo que publicas, estás dentro. La clave es que sea demostrable y no implícito.

Lo que yo haría, en este orden:

  1. Publica una política editorial. Dos párrafos donde digas quién escribe, que usas asistentes de IA como herramienta, que todo pasa por revisión y verificación humana antes de publicar, y que la responsabilidad editorial es tuya y nominal. La mía está en el aviso legal, por si te sirve de plantilla. Cubre la excepción del 50(4) y de paso es exactamente la señal de autoría que Google y los buscadores de IA quieren ver.
  2. Firma los artículos con nombre y cara. "Responsabilidad editorial asignada" significa que alguien concreto responde, no que alguien le echó un vistazo.
  3. Etiqueta solo lo que lo pida. Una imagen fotorrealista de una persona o un hecho real generada con IA, o audio con voz sintética, llevan aviso visible desde el primer contacto. El resto, no.
  4. Si escribes para clientes, ponlo por escrito. Cuando produces contenido que publica otro, el contrato debería decir quién asume la responsabilidad editorial. Si la asume el cliente y no revisa nada, el problema se lo queda él, pero conviene que esté escrito.
  5. Guarda tu propio rastro. Git, fechas de actualización, notas de corrección. No dependas de una marca de agua ajena para demostrar tu proceso.

Y lo que no haría: colgar un "generado con IA" de todos los posts. No lo pide la norma si tienes control editorial, te resta credibilidad y es justo lo que Google criticó al firmar el Código: exceso de etiquetas que confunde en lugar de informar. Una declaración de proceso, hecha una vez y bien, es mejor que un banner en cada artículo.

Cómo encaja con el resto de la industria

Google firmó el 24 de julio y apoya su cumplimiento en SynthID, que ya despliega en Gemini, más adopción de C2PA. Anunció además trabajo conjunto con Apple, Eleven Labs, Kakao, NVIDIA y OpenAI para empujar interoperabilidad entre herramientas de marcado. En la misma nota deja una queja explícita: le preocupa que sumar complejidad regulatoria mientras las soluciones técnicas siguen evolucionando choque con los objetivos europeos de competitividad, y que un exceso de etiquetas confunda al consumidor en lugar de informarlo.

Esa tensión es real y no se resuelve firmando un código. La Comisión reconoce en el propio texto que los benchmarks de evaluación están poco desarrollados, que la detección forense no es fiable y que términos centrales, como la frontera entre deepfake y edición, requieren evaluación caso por caso.

Lo que sí ha conseguido el Código es alinear a los proveedores grandes alrededor de dos técnicas concretas, watermark en contenido y C2PA en metadatos, en lugar de diez formatos propietarios incompatibles. Para quien construye encima, esa convergencia vale más que la norma.

Y la convergencia es mayor de lo que parecía en agosto: al confirmar que Claude usa una versión de SynthID-Text, resulta que Anthropic y Google no están aplicando dos soluciones parecidas sino la misma familia de técnicas, publicada por uno de los dos y adoptada por el otro. Con una consecuencia que conviene no perder de vista: cada proveedor tiene su propia clave, así que la interoperabilidad de la que habla el Código sigue sin existir. Un texto marcado por Claude no lo puede verificar Google, y viceversa. Compartir el método no es compartir la capacidad de detectar.

Mi lectura

Tres cosas me quedan de todo esto.

La primera: la marca es una señal, no una prueba, y Anthropic lo dice con todas las letras. Esperar que resuelva el problema de "¿esto lo escribió una IA?" es esperar de más. Lo que sí resuelve, parcialmente, es el problema inverso: dar procedencia verificable a contenido que quiere ser verificable.

La segunda: el efecto Bruselas otra vez. Un reglamento europeo acaba definiendo cómo se comporta un modelo para un usuario en México o en Japón, porque mantener dos comportamientos cuesta más que cumplir para todos.

La tercera, y la más práctica: la obligación visible sigue siendo humana. La marca de agua es invisible por diseño. Lo que el usuario ve, la etiqueta, el aviso, el "esto lo generó una IA", lo tienes que poner tú. Ninguna capa técnica del proveedor te ahorra esa decisión de producto.

Preguntas frecuentes

¿Claude tiene marca de agua?

Sí. Desde el 2 de agosto de 2026, el texto que generan los modelos nuevos de Claude lleva una marca de agua invisible incrustada en el propio texto, y los archivos que produce salen con metadatos de procedencia C2PA firmados. No se ve, no cambia lo que lees y no se activa ni se desactiva desde la interfaz: viene puesta.

¿Se puede quitar la marca de agua de Claude?

Anthropic no documenta ninguna forma de desactivarlo, y el alcance que publicó apunta a lo contrario: aplica a todos sus productos y en todas las regiones. Conviene además entender qué se estaría quitando: la marca vive en la elección de palabras del propio texto, así que editarlo a fondo la degrada, mientras que copiar y pegar tal cual la conserva. Los metadatos C2PA de los archivos son otra cosa y sí se pierden con facilidad, porque cualquier recorte, recompresión o captura de pantalla los borra. Que sobreviva poco no es un fallo: la marca se diseñó como señal de procedencia, no como candado.

¿El código que escribe Claude lleva marca de agua?

El marcado se aplica al texto generado por los modelos, y el código es texto. Pero en la práctica es donde peor sobrevive: los fragmentos cortos no dan margen suficiente para que la señal sea fiable, y el código pasa por formateadores, refactors y revisiones que reescriben justo lo que la marca usa. No lo trates como una forma de saber si un fragmento salió de una IA.

¿Cómo se detecta la marca de agua de Claude?

Hoy no puedes. Anthropic confirmó el método pero la API de detección todavía no existe, así que no hay forma pública de verificar un texto. Los metadatos C2PA de los archivos sí son verificables con las herramientas de la Content Authenticity Initiative, siempre que el archivo no haya pasado por nada que se los coma.

¿Es lo mismo que un detector de IA?

No, y es la confusión más común. Un detector de IA hace una conjetura estadística sobre cualquier texto y se equivoca en las dos direcciones. La marca de agua solo responde por el contenido que salió de Claude ya marcado: si aparece, es una señal fuerte de procedencia; si no aparece, no prueba nada, porque pudo generarlo otro modelo, ser anterior a agosto de 2026 o haber sido reescrito. Es una señal, no una prueba.

Fuentes