O Claude vai usar marcas de água no texto. A razão é a UE

Os modelos Claude vão marcar o texto pelas palavras que escolhem, não com caracteres ocultos. A razão é o AI Act da UE, não a guerra da destilação.

Lançamentos
Nesta página
  1. Como é que uma marca de água sobrevive ao copiar e colar sem caracteres ocultos?
  2. Porque é que a Anthropic está a fazer isto?
  3. A marca de água do Claude destina-se mesmo aos laboratórios chineses?
    1. Porque é que a teoria da China é plausível
    2. Porque continuo a considerar mais convincente a explicação da UE
  4. O que prova realmente a deteção da marca de água do Claude?
    1. Texto curto, editado ou exato pode escapar à deteção
    2. Uma reescrita completa pode remover a marca de água
    3. A marca não identifica o utilizador nem o proprietário
  5. O que muda no código, na prosa e nos ficheiros do Claude?
    1. Os ficheiros usam uma credencial C2PA separada

A Anthropic confirmou a 14 de agosto de 2026 que os futuros modelos Claude vão usar uma marca de água, ou «watermark» em inglês [1]. Ela não usa caracteres ocultos: vive nas palavras escolhidas pelo Claude. E a razão declarada não é combater laboratórios chineses que copiam o Claude. É o AI Act da UE [1].

Um gráfico que circulou nas redes sociais afirmava que «o Claude vai agora aplicar uma marca de água invisível ao texto gerado por IA, para que possa ser detetado depois de copiado e colado». A frase é surpreendentemente exata, mas «invisível» dá a entender que foram acrescentados dados ocultos ao texto. A explicação técnica da Anthropic mostra algo bastante diferente.

Como é que uma marca de água sobrevive ao copiar e colar sem caracteres ocultos?

Porque a marca de água não está anexada ao texto. Ela é o texto. O Claude marca o que escreve através das palavras que escolhe quando várias opções serviriam igualmente bem. O Claude Help Center explica a consequência de forma direta: a marca faz parte do texto, por isso acompanha-o quando é copiado e colado noutro lugar [2].

O mecanismo funciona assim, segundo a Anthropic. Um modelo de linguagem escreve escolhendo sucessivamente a palavra seguinte. Em muitos pontos, a escolha quase não altera o sentido, porque várias palavras encaixariam. Normalmente, o modelo escolhe ao acaso entre essas opções aceitáveis. A marca de água mantém essa aleatoriedade, mas muda a sua origem: em vez de um gerador de números aleatórios arbitrário, o modelo combina uma chave secreta com algumas das palavras anteriores para decidir qual opção usar [1]. Ao repetir este processo nas muitas escolhas de baixo risco de uma passagem, deixa um padrão que o leitor não vê, mas que qualquer pessoa com a chave pode testar [1]. Nada é acrescentado ao texto, não há caracteres ocultos e a marca não exige tokens adicionais, pelo que não torna o Claude mais caro de disponibilizar nem de usar [1].

A Anthropic é igualmente clara sobre o que a marca de água não faz: nunca empurra o Claude para uma palavra que ele não teria considerado de qualquer forma. O exemplo do anúncio é «nubilous», um sinónimo inglês obscuro de céu encoberto que o Claude quase nunca usaria; a marca só muda a forma como se decide entre palavras plausíveis [1].

A abordagem é emprestada, e a Anthropic assume-o abertamente. A marca de água do Claude é uma versão do SynthID-Text, que a Google DeepMind publicou na revista Nature em 2024, e esta família de métodos remonta a uma proposta de Scott Aaronson em 2022 [1]. A descrição da própria DeepMind coincide com a da Anthropic: o SynthID ajusta as pontuações de probabilidade dos tokens candidatos durante a geração, e o padrão final dessas pontuações nas escolhas do modelo forma a marca de água [3].

O artigo da Nature é a razão pela qual levo a sério a afirmação de que a qualidade não sofre. Numa experiência em produção no Gemini que abrangeu quase 20 milhões de respostas, a taxa de avaliações positivas do modelo com marca diferiu da do modelo sem marca em 0,01%, e a taxa de avaliações negativas em 0,02%. Nenhuma das diferenças foi estatisticamente significativa [4]. A Anthropic relata o mesmo nos seus testes internos: não mediu qualquer impacto no conteúdo, na criatividade ou na legibilidade do texto do Claude [1].

A deteção aplica o mesmo mecanismo ao contrário. Com a chave, um detetor pode verificar se uma passagem contém as escolhas que uma geração marcada teria favorecido com uma frequência muito superior à explicada pelo acaso. O sinal acumula-se palavra a palavra, por isso a confiança no envolvimento do Claude aumenta com o comprimento da passagem. Um texto muito curto contém escolhas insuficientes para permitir uma conclusão [1]. A afirmação sobre copiar e colar está correta porque não existe nada anexado ao texto que possa ser removido. A razão para o momento do anúncio exige outra análise.

Porque é que a Anthropic está a fazer isto?

Para cumprir o AI Act da UE. A Anthropic di-lo diretamente [1]. O n.º 2 do artigo 50.º do Regulamento (UE) 2024/1689, publicado no EUR-Lex, exige que os fornecedores de sistemas de IA que geram texto, áudio, imagens ou vídeo marquem os resultados num formato legível por máquina e detetável como conteúdo gerado por IA [5].

As datas explicam o anúncio em agosto. As perguntas frequentes da Comissão Europeia sobre o artigo 50.º indicam que as obrigações se aplicam desde 2 de agosto de 2026, com um período de tolerância restrito: os sistemas que já estavam no mercado antes dessa data têm até 2 de dezembro de 2026 para cumprir a obrigação de marcação e deteção [6]. As consequências não são simbólicas, pois as coimas podem chegar aos 15 milhões de euros ou a 3% do volume de negócios mundial do exercício anterior [6].

A Anthropic também escolheu a mais previsível das duas vias de conformidade. Em julho de 2026, assinou o Código de Práticas da UE sobre a transparência de conteúdos gerados por IA [1]. A página da Comissão sobre o código explica a vantagem: os signatários podem usar as medidas do código para demonstrar conformidade, enquanto os fornecedores que adotem uma abordagem própria têm de convencer individualmente as autoridades de fiscalização do mercado de que as suas medidas são adequadas [7]. No final de julho de 2026, cerca de 190 organizações tinham assinado. Entre os signatários de IA destacados pela Comissão estavam a Anthropic, a Google, a Meta, a Microsoft, a Mistral e a OpenAI [8]. As marcas de água em texto não serão exclusivas do Claude.

O que é que a UE quer, afinal, evitar? As orientações da Comissão sobre estas obrigações de transparência descrevem o problema: o conteúdo de IA está a tornar-se difícil de distinguir do conteúdo humano, o que aumenta os riscos de desinformação e manipulação em grande escala, fraude, usurpação de identidade e engano dos consumidores [9].

Um detalhe parece estranho numa regra europeia: a marca de água será aplicada em todo o mundo. A explicação da Anthropic é operacional, não jurídica. A empresa ainda não dispõe de uma forma fiável de limitar a marcação por região, por isso aplica-a globalmente no lançamento e diz que continuará a avaliar outras abordagens [1]. O Claude Help Center confirma o alcance: a marcação aplica-se aos resultados dos modelos compatíveis onde quer que o Claude seja disponibilizado [2]. Este detalhe importa na secção seguinte.

A marca de água do Claude destina-se mesmo aos laboratórios chineses?

A Anthropic apresenta a conformidade com a UE como o objetivo da marca de água, e não encontrei qualquer declaração pública que a relacione com laboratórios chineses [1]. A teoria da China é tecnicamente plausível, mas continua a ser uma interpretação do calendário e da investigação separada que apresento abaixo, não um facto documentado. Uma empresa pode, ainda assim, ter mais do que uma razão para o mesmo lançamento.

Porque é que a teoria da China é plausível

A teoria liga dois factos documentados. A Anthropic acusou laboratórios chineses de destilação de modelos, ou «model distillation» em inglês, que consiste em treinar um modelo com os resultados produzidos pelo Claude [10]. Por outro lado, um artigo do arXiv apresentado no NeurIPS 2024 concluiu que vestígios de uma marca de água podem sobreviver no modelo treinado [13]. A interpretação é que apanhar esses laboratórios constitui o verdadeiro objetivo e que o AI Act da UE oferece uma justificação conveniente. Esta foi também uma segunda leitura que algumas pessoas fizeram do momento em que o gráfico viral apareceu.

A disputa em torno da destilação está bem documentada. A 23 de fevereiro de 2026, a Anthropic afirmou ter identificado campanhas à escala industrial da DeepSeek, da Moonshot e da MiniMax para extrair as capacidades do Claude: mais de 16 milhões de interações com o Claude através de cerca de 24 mil contas fraudulentas, dirigidas ao raciocínio agêntico, ao uso de ferramentas e à programação [10]. A Reuters noticiou as acusações no mesmo dia e referiu que nenhuma das três empresas respondeu de imediato [11].

A operação de junho foi maior. A 24 de junho de 2026, a Reuters noticiou, com base numa carta enviada pela Anthropic a dois senadores norte-americanos, que operadores ligados à Alibaba e ao laboratório Qwen geraram mais de 28,8 milhões de interações através de quase 25 mil contas fraudulentas entre 22 de abril e 5 de junho de 2026. A Anthropic classificou-a como o maior ataque conhecido deste tipo contra a empresa. A Alibaba também não respondeu de imediato [12].

A investigação sobre marcas de água sustenta a premissa técnica da teoria. Num artigo apresentado no NeurIPS 2024, Tom Sander e os seus colegas mostraram que as marcas de água tornam os modelos de linguagem «radioativos»: um modelo afinado com texto marcado herda vestígios fracos, mas detetáveis, da marca. Num modelo de pesos abertos, conseguiram demonstrar com elevada confiança que tinham sido usadas instruções marcadas no treino, mesmo quando apenas 5% do texto de treino continha a marca [13].

Outros estudos mostram os limites. Um artigo do arXiv de Leyi Pan e colegas, aceite na ACL 2025, testou se as marcas de água conseguem impedir a destilação não autorizada de conhecimento e encontrou duas formas de as contornar: parafrasear os dados de treino antes da destilação ou neutralizar a marca durante a inferência, depois do treino. Ambos os métodos removeram por completo as marcas herdadas. O segundo manteve a capacidade transferida e acrescentou pouco custo [14].

Entretanto, os investigadores criaram marcas de água especificamente para este confronto. Em maio de 2026, o laboratório FAIR da Meta publicou no arXiv o TextSeal, uma marca concebida para continuar detetável depois da destilação e apresentada diretamente como alternativa ao SynthID-Text. Entre os seus autores estão os principais investigadores do artigo sobre radioatividade [15].

Porque continuo a considerar mais convincente a explicação da UE

Os documentos oficiais continuam a apontar para a conformidade com a UE. A Anthropic indica o AI Act da UE como razão para a marca de água [1], enquanto a sua publicação de fevereiro sobre os ataques de destilação apresenta outro conjunto de defesas: classificadores e impressões digitais comportamentais para o tráfego da API, deteção de atividade coordenada entre contas, verificação mais exigente para os tipos de conta mais usados em abusos e contramedidas destinadas a tornar os resultados menos úteis para a destilação ilícita [10].

O lançamento mundial torna menos convincente, para mim, a hipótese de a destilação ser o objetivo principal. A Anthropic afirma que aplica a marca globalmente porque ainda não tem uma forma fiável de a limitar por região e continua à procura de uma [1]. Se apanhar destilação fosse o principal objetivo, investigar formas de desligar a marca fora da Europa seria uma decisão estranha.

O calendário aponta na mesma direção. O anúncio da marca de água chegou doze dias depois de o artigo 50.º começar a aplicar-se e bem antes do prazo de 2 de dezembro de 2026 para os sistemas mais antigos; ao mesmo tempo, chegou quase seis meses depois das acusações contra a DeepSeek e sete semanas depois da carta sobre a Alibaba. Postos os dois calendários lado a lado, a explicação da conformidade precisa simplesmente de menos suposições: todas as datas da marca de água acompanham uma obrigação europeia, enquanto as datas da destilação ficam a meses de distância.

  1. Acusações de destilação

    A Anthropic nomeia a DeepSeek, a Moonshot e a MiniMax.

  2. Acusação à Alibaba

    A Reuters noticia 28,8 milhões de interações através de contas fraudulentas.

  3. Contagem do Código de Práticas

    A Comissão conta cerca de 190 signatários, incluindo a Anthropic.

  4. Artigo 50.º aplica-se

    Os novos sistemas de IA têm de marcar o conteúdo gerado.

  5. Marca de água anunciada

    Os futuros modelos Claude vão marcar o seu texto.

  6. Prazo para sistemas antigos

    A obrigação de marcação chega aos sistemas anteriores a 2 de agosto de 2026.

Figura 1. O lançamento da marca de água do Claude ocorreu 12 dias depois de o artigo 50.º começar a aplicar-se.

A minha leitura é que a conformidade com a UE explica este lançamento, enquanto a deteção de destilação é um possível efeito secundário. Os factos documentados apoiam esta distinção: a Anthropic combate a destilação com ferramentas que nomeia, e a marca de água do Claude tem um único propósito documentado, a conformidade com a UE. Se texto marcado pelo Claude acabar nos dados de treino de alguém, a investigação sobre radioatividade indica que a Anthropic poderá ainda ganhar uma forma de deteção, quer alguém tenha planeado esse resultado quer não [13]. Falta perceber o que essa deteção provaria.

O que prova realmente a deteção da marca de água do Claude?

Que o Claude esteve provavelmente envolvido, e pouco mais. A Anthropic afirma que a sua chave estima a probabilidade de o Claude ter escrito parte do texto. Uma correspondência não distingue um texto escrito pelo Claude de um texto profundamente editado pelo Claude. Também não confirma autoria humana nem reconhece a IA de outra empresa, que usaria outra chave ou outro método [1].

Uma marca pode até exagerar o envolvimento. O Claude Help Center nota que o output pode trazer uma marca do Claude quando as ideias, o texto ou os dados de base vieram de outra fonte, por isso uma deteção diz que o Claude processou as palavras em algum momento, não de onde vieram as ideias [2].

Texto curto, editado ou exato pode escapar à deteção

Um resultado negativo prova ainda menos. O centro de ajuda enumera as situações em que o conteúdo marcado deixa de ser detetável: a passagem é muito curta ou o texto foi profundamente editado, parafraseado, traduzido ou misturado com outro conteúdo [2]. O texto também pode vir de um modelo Claude que ainda não usa a marca, porque os modelos lançados antes de 2 de agosto de 2026 continuam em transição. A Anthropic afirma que a marcação desses modelos será introduzida ao longo dos próximos meses [1] [2].

A tradução funciona nos dois sentidos. Uma tradução produzida pelo Claude recebe uma nova marca de água, pois todas as palavras resultam de escolhas do Claude [1]. Se um texto já marcado passar por outro tradutor, as escolhas de palavras são substituídas e o sinal pode desaparecer [2].

A marca de água também varia por definição. Quando só existe uma resposta correta, não é aplicada, porque escolher outra palavra tornaria o texto errado. O exemplo da Anthropic é completar «A obra mais famosa de Isaac Newton chamava-se Principia», em que «Mathematica» é a única resposta certa. Nesse caso, a marca não tem onde atuar [1]. A mesma lógica reduz o sinal no código, que tem sobretudo de ser exato. As escolhas livres, como a redação dos comentários, podem transportá-lo, mas a Anthropic espera um efeito insignificante no código produzido [1]. A revisão de texto comporta-se da mesma forma: quando o Claude apenas corrige gramática e pontuação num texto humano, a marca só pode estar nesse pequeno conjunto de correções, que pode ser insuficiente para deteção [1]. Este comportamento também coincide com a lei, porque o artigo 50.º isenta a IA que desempenha uma função auxiliar na edição normal ou que não altera substancialmente o conteúdo recebido [5].

Uma reescrita completa pode remover a marca de água

Ninguém fora da Anthropic testou ainda a versão do Claude, mas a família SynthID-Text já foi analisada. Em dezembro de 2024, o SRI Lab da ETH Zurich avaliou o SynthID-Text num modelo Llama instalado localmente e concluiu que era mais difícil de falsificar do que sistemas comparáveis, mas mais fácil de apagar. A paráfrase removeu-o com maior facilidade do que outras marcas de água avançadas, mesmo quando o atacante usou apenas ferramentas comuns de paráfrase [16]. A própria Anthropic reconhece o limite: uma edição ligeira provavelmente não remove a marca por completo, mas uma reescrita total, em que todas as palavras são substituídas, consegue fazê-lo. Nessa altura, torna-se discutível se o texto ainda é gerado por IA [1].

A marca não identifica o utilizador nem o proprietário

A marca de água não contém informação sobre si. A Anthropic afirma que nem a marca nem a chave permitem recuperar dados sobre o utilizador, a sua organização ou as suas conversas, e que a marca não altera a propriedade do resultado nem os direitos do utilizador [1]. Por enquanto, ninguém fora da Anthropic consegue verificá-la. A deteção exige a chave, razão pela qual os detetores de IA de terceiros recorrem a outros métodos [1]. A API de deteção que a Anthropic afirma que disponibilizará em breve ainda não tinha detalhes publicados sobre implementação, limiares ou acesso a 17 de agosto de 2026 [1].

O que muda no código, na prosa e nos ficheiros do Claude?

No trabalho diário, muda muito pouco. Os modelos Claude compatíveis marcam a prosa onde quer que sejam executados, o código transporta pouco sinal quando a exigência de exatidão deixa poucas escolhas de palavras e os ficheiros compatíveis recebem uma credencial C2PA separada nos metadados [1]. O lançamento segue os modelos, não os produtos Claude individuais [2].

Isto significa que um modelo compatível marca o texto onde quer que seja executado: nas aplicações Claude, na API da Claude Platform, no Claude Code, no Claude Cowork ou no Claude Tag, bem como através da AWS, Google Cloud e Microsoft Foundry [2]. A Anthropic observa que algumas plataformas ou funcionalidades podem não suportar todos os tipos de marcação [2]. Os modelos lançados a partir de 2 de agosto de 2026 usam a marca desde o primeiro dia; os modelos anteriores recebem a capacidade à medida que a transição avança [2]. Não existe um único dia em que todo o texto do Claude passa a estar marcado, pelo que a deteção também não se tornará fiável em todos os contextos ao mesmo tempo.

Para quem programa, o efeito prático deverá continuar a ser pequeno. O código tem sobretudo de ser exato, e resultados exatos não são marcados. A Anthropic espera um efeito insignificante no código produzido pelo Claude, pelo que, numa sessão de programação, o sinal estará principalmente onde a redação é livre, como nos comentários [1]. A prosa normal dá mais espaço à marca de água. Tanto os testes internos da Anthropic como a experiência da DeepMind com o Gemini indicam que a qualidade não sofre alterações mensuráveis [1] [4].

Os ficheiros usam uma credencial C2PA separada

Os ficheiros recebem um tratamento completamente diferente. Quando o Claude produz um tipo de ficheiro suportado, como .png, .jpg ou .svg, anexa-lhe uma credencial de conteúdo: uma pequena nota assinada criptograficamente nos metadados do ficheiro, a registar que este foi criado ou processado com o Claude [1]. O formato é o C2PA, da Coalition for Content Provenance and Authenticity, uma norma técnica aberta para estabelecer a proveniência e o histórico de edição de conteúdos digitais, a mesma que os fabricantes de câmaras e o software de edição de fotografia usam [1] [17]. Qualquer ferramenta compatível com C2PA consegue ler a credencial, e a Anthropic diz que vai disponibilizar a sua própria ferramenta de verificação [1].

A minha leitura dos dois mecanismos é que falham em direções opostas. A marca de água no texto sobrevive ao copiar e colar porque é formada pelas próprias palavras e só se desvanece quando a edição as substitui [2]. A credencial do ficheiro não altera o conteúdo, mas vive nos metadados, que se perdem quando alguém tira uma captura de ecrã, converte o formato ou guarda novamente o ficheiro [2].

Propriedade Marca de água no texto Credencial C2PA no ficheiro
Onde vive o sinal No padrão das escolhas de palavras Em metadados assinados anexados ao ficheiro
Altera o próprio conteúdo Não Não
Sobrevive ao copiar e colar Sim, a marca é o texto Só se os metadados acompanharem a cópia
O que a remove Uma reescrita que substitui as palavras Capturas de ecrã, conversão de formato, voltar a guardar
Identifica o utilizador Não Não
Como verificar A chave da Anthropic; está prevista uma API de deteção Qualquer ferramenta compatível com C2PA
Figura 2. Marca de água no texto vs. credencial C2PA no ficheiro: duas marcas com pontos fracos opostos.

A marca de água do Claude não é o detetor de IA que professores e editores continuam a pedir. Sem a chave não existe nada para verificar, e mesmo com ela a resposta será uma probabilidade, não um veredicto [1]. A Anthropic está, em vez disso, a incorporar proveniência nos modelos porque a lei o exige e cerca de 190 organizações concordaram sobre a forma de o fazer [8]. O meu próximo passo é concreto: quando a API de deteção aparecer, vou testar os meus artigos publicados e um conjunto de transcrições do Claude, e registar o comportamento dos valores de confiança em textos de diferentes comprimentos.

Fontes

  1. How Claude's text watermark worksAnthropic · 2026-08-14
  2. How Claude marks AI-generated contentClaude Help Center · 2026-08-10
  3. Watermarking AI-generated text and video with SynthIDGoogle DeepMind · 2024-05-14
  4. Scalable watermarking for identifying large language model outputsNature · 2024-10-23
  5. Regulation (EU) 2024/1689 (Artificial Intelligence Act)EUR-Lex · 2024-06-13
  6. Transparency obligations under Article 50 of the AI ActEuropean Commission · 2026-07-24
  7. Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  8. Strong backing for the Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  9. Guidelines on transparency obligations for providers and deployers of certain AI systemsEuropean Commission · 2026-08-06
  10. Detecting and preventing distillation attacksAnthropic · 2026-02-23
  11. Chinese AI companies 'distilled' Claude to improve own models, Anthropic saysReuters · 2026-02-23
  12. Anthropic says Alibaba illicitly extracted Claude AI model capabilitiesReuters · 2026-06-24
  13. Watermarking Makes Language Models RadioactivearXiv · 2024-02-22
  14. Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?arXiv · 2025-02-17
  15. TextSeal: A Localized LLM Watermark for Provenance & Distillation ProtectionarXiv · 2026-05-12
  16. Probing Google DeepMind's SynthID-Text WatermarkETH Zurich SRI Lab · 2024-12-20
  17. Coalition for Content Provenance and Authenticity (C2PA)C2PA