Marca d'Água em
Large Language Models

Dois simuladores interativos para explorar como funcionam as técnicas de marca d'água que tornam possível identificar texto gerado por IA — sem degradar a qualidade.

Kirchenbauer et al. 2023 Dathathri et al. 2024 Integração com Ollama Código aberto
🟢

Green List Watermark

Kirchenbauer, Geiping, Wen, Katz, Miers & Goldstein · arXiv:2301.10226

O método que introduziu o conceito de lista verde/vermelha. Para cada token, o vocabulário é particionado pseudo-aleatoriamente — tokens "verdes" recebem um bias +δ nos logits. A detecção conta quantos tokens estão na lista verde e aplica um teste z.

z-score γ (gamma) δ (delta) lista verde/vermelha
Abrir simulador
🏆

SynthID-Text Tournament

Dathathri, See, Ghaisas et al. · Nature 2024 · doi:10.1038/s41586-024-08025-4

O método em produção no Google Gemini. Usa torneio multicamada: N candidatos são eliminados rodada a rodada por g-functions independentes. Cada camada fornece evidência estatística adicional, resultando em maior detectabilidade.

tournament sampling g-values m camadas non-distortionary
Abrir simulador

Por que marca d'água em LLMs?

Com a crescente capacidade de modelos de linguagem gerar texto indistinguível do humano, torna-se essencial mecanismos para identificar conteúdo sintético. A marca d'água insere um sinal estatístico invisível ao olho humano, mas detectável algoritmicamente — permitindo atribuir textos a LLMs sem depender de classificadores pós-hoc, que são vulneráveis a adversários e podem ter taxas altas de falso positivo.

Ambos os métodos aqui simulados compartilham uma propriedade crucial: a detecção não requer acesso ao modelo. Qualquer terceiro com a chave secreta pode verificar se um texto foi gerado por um LLM watermarkado.

Green List (Kirchenbauer)

  • Mecanismo: particionamento verde/vermelho + bias δ
  • Seed: hash de 1 token anterior
  • Score: z-score da proporção verde
  • Detecção: teste estatístico unilateral
  • Vantagem: simples de implementar e analisar

SynthID-Text (Tournament)

  • Mecanismo: torneio multicamada com g-functions
  • Seed: hash de H=4 tokens anteriores
  • Score: média dos g-values (mean g-score)
  • Detecção: média > 0.5 indica watermark
  • Vantagem: maior detectabilidade, em produção no Gemini

Pré-requisitos

  1. Instale o Ollama e execute ollama serve
  2. Baixe ao menos um modelo: ollama pull llama3.2 (ou qualquer modelo de linguagem)
  3. Abra o index.html no navegador e clique "Conectar" na URL do Ollama
  4. Selecione o modelo, escreva um prompt e clique em "Gerar"