Hace unos meses me suscribí a Medium, para probarlo más que nada y chequear si podía leer cosas interesantes. Ya les digo que vale la pena. Recomendado. Y luego de leer varios artículos, mientras tomaba mi café en la cafetería que voy todos los días (sí, voy todos los días pero eso puede ser otro post), hubo uno que me llamó poderosamente la atención titulado Claude Is Watermarking AI Text: Everything You Need to Know. Me dije ¿qué es esto? ¿Van a agregar palabras o espacios en los textos? La respuesta es no, es algo mucho más interesante y por eso lo comparto acá.
¿Qué es realmente un watermark en texto?
Primero deberíamos explicar qué es “watermark” o “marca de agua”. Cuando pensamos en esto lo imaginamos como algo visible o escondido dentro de una foto, un PDF o un archivo. Pero en este caso ocurre algo distinto. No hay una etiqueta escondida. No hay una palabra secreta que diga “esto lo escribió Claude”. La marca aparece en la forma en que la IA va eligiendo las palabras.
Para que entiendas mejor cómo escribe una IA o un LLM como Claude, ChatGPT o Gemini, no “piensa una frase completa” y después la escribe. Va construyendo el texto palabra por palabra, eligiendo entre distintas continuaciones posibles. Por ejemplo:
La reunión fue bastante…
podría continuar con:
- útil
- productiva
- interesante
- práctica
Todas son opciones razonables. La IA calcula cuáles son más probables y elige una.
En este punto está la clave, Anthropic puede hacer que, entre varias palabras igualmente válidas, Claude tenga una pequeña preferencia por algunas de ellas. Una vez no significa nada. Pero si ocurre cientos o miles de veces, aparece un patrón. Ese patrón puede ser detectado después por un sistema que sabe qué buscar. Para que lo entiendas mejor, te doy un ejemplo…
La clave está en la estadística
Imaginate una moneda trucada: si la tirás 5 veces y salen 4 caras, no podemos concluir nada. Pero si la tirás 10.000 veces y salen 6.500 caras, probablemente la moneda no sea completamente aleatoria. Con los textos ocurre algo parecido: ninguna palabra individual revela que el texto fue generado por Claude. Lo que se detecta es el patrón que aparece después de muchas elecciones.
Pero ojo, esto no es imbatible, y hay maneras de evitarlo… ¿saben cómo? Con el toque humano. Si una persona reescribe profundamente el texto, las palabras originales cambian. Por ejemplo tenemos el texto:
La nueva política produjo una caída muy rápida de la demanda.
Reescritura:
Después del cambio de política, la demanda cayó mucho más rápido de lo esperado.
La idea es prácticamente la misma. Pero las palabras elegidas son diferentes. Por eso el patrón puede debilitarse o desaparecer. En textos largos sucede lo contrario, cuantas más palabras, más fácil de encontrar el patrón. Esto explica por qué no tendría sentido pensar que cada frase generada por Claude será automáticamente detectable.
Detectar participación no es lo mismo que detectar autoría
Hay una distinción importante en este punto: que un texto tenga una marca compatible con Claude no significa necesariamente que Claude haya tenido la idea o escrito todo desde cero. Podría pasar que una persona escriba un artículo completo, con sus ideas y su forma de pensar, y después le pida a Claude que lo haga más claro, más corto o más profesional. En ese caso, las ideas siguen siendo humanas, aunque la redacción final haya pasado por la IA. Dicho de otra manera, el watermark podría decirnos “Claude participó en este texto”, pero no necesariamente “Claude es el autor de este texto”. Y esa diferencia, para mí, es clave. ¿Será el caso de este artículo? jeje
Un ejemplo donde podría pasar esto, es que escribas un texto largo y lo pases por Claude y le digas “Reescribí todo esto para que suene más profesional”, en ese caso la IA elegiría muchísimas palabras y booom, ahí probablemente aparezca el patrón. Para el caso de escribir código es distinto. Si una línea tiene que devolver true, no existen veinte formas igualmente válidas de escribir ese resultado. Por eso el watermark puede ser más difícil de aplicar en código que en texto creativo.
¿Por qué Anthropic está haciendo esto?
Si llegaste a este punto del artículo, primero gracias, te deberías estar preguntando: ¿Por qué lo hacen? La respuesta es regulatoria: una de las razones principales es el AI Act de la Unión Europea, que introduce nuevas obligaciones de transparencia para contenido generado por inteligencia artificial. Ya que a medida que la IA genera más contenido, empieza a ser importante poder distinguir contenido humano, contenido sintético y contenido modificado por IA. Algunos ejemplos:
- spam generado automáticamente.
- artículos publicados en masa.
- contenido manipulado.
- información falsa generada a escala.
Una hipótesis interesante que planteaba el post que originó este artículo, decía que cada vez hay más texto generado por la IA y, ohh casualidad, modelos futuros serán entrenados por información obtenida de internet y justamente el watermark podría identificarlo y filtrarlo en estos entrenamientos.
Definitivamente el post me llamó la atención y lo primero que pensé fue: “Anthropic ahora marca todo lo que escribimos”, pero me puse a investigar y la realidad me pareció menos inquietante y mucho más interesante. La estadística es la clave de todo esto…
Si querés profundizar un poco más en cómo funciona técnicamente, Anthropic publicó una explicación oficial del watermark de Claude acá.
El toque humano sigue siendo la clave
Después de investigar todo esto, me quedó dando vueltas una idea. Quizás estamos demasiado preocupados por saber si algo fue escrito por una IA o por una persona, cuando cada vez va a ser más difícil separar una cosa de la otra.
Podemos tener una idea, escribir un primer borrador, pedirle a una IA que nos ayude a ordenarlo, volver a cambiarlo, discutir algunas partes con ella y finalmente decidir qué queremos publicar.
Para mí, ahí sigue estando la diferencia. La IA puede ayudarnos a llegar más rápido, mostrarnos caminos que no habíamos visto o incluso cuestionar nuestras propias ideas. Pero la intención, el criterio y la decisión final siguen siendo humanos.
La IA puede acelerar nuestras ideas. Pero todavía somos nosotros quienes les damos dirección, intención y sentido.
Si querés ver una explicación más técnica de cómo se genera el watermark a nivel de tokens, encontré este post en X que lo ilustra muy bien.
