Dois simuladores interativos para explorar como funcionam as técnicas de marca d'água que tornam possível identificar texto gerado por IA — sem degradar a qualidade.
O método que introduziu o conceito de lista verde/vermelha. Para cada token, o vocabulário é particionado pseudo-aleatoriamente — tokens "verdes" recebem um bias +δ nos logits. A detecção conta quantos tokens estão na lista verde e aplica um teste z.
Abrir simuladorO método em produção no Google Gemini. Usa torneio multicamada: N candidatos são eliminados rodada a rodada por g-functions independentes. Cada camada fornece evidência estatística adicional, resultando em maior detectabilidade.
Abrir simuladorCom a crescente capacidade de modelos de linguagem gerar texto indistinguível do humano, torna-se essencial mecanismos para identificar conteúdo sintético. A marca d'água insere um sinal estatístico invisível ao olho humano, mas detectável algoritmicamente — permitindo atribuir textos a LLMs sem depender de classificadores pós-hoc, que são vulneráveis a adversários e podem ter taxas altas de falso positivo.
Ambos os métodos aqui simulados compartilham uma propriedade crucial: a detecção não requer acesso ao modelo. Qualquer terceiro com a chave secreta pode verificar se um texto foi gerado por um LLM watermarkado.
ollama serveollama pull llama3.2 (ou qualquer modelo de linguagem)index.html no navegador e clique "Conectar" na URL do Ollama