A visualização mostra o bracket do torneio para cada token,
a matriz de g-values e o score de detecção acumulado.
Um hash dos últimos H tokens (janela deslizante) + chave secreta gera a seed rt para cada posição.
Sample Nm tokens da distribuição do LLM. Estes são os participantes iniciais do torneio.
Cada camada ℓ usa uma g-function independente gℓ(token, seed) para eliminar candidatos. Sobram Nm-ℓ a cada rodada.
O último sobrevivente do torneio é o token xt. Seus g-values ao longo das camadas formam a "assinatura" da marca d'água.
Para detectar: calcula-se a média de todos os g-values do texto. Texto marcado terá média > 0.5 (esperado ~0.5 para não-marcado). Quanto mais tokens e camadas, maior a evidência estatística.
Quando N=2 (dois candidatos por match), o Tournament é single-token non-distortionary: em média, a distribuição de saída é idêntica à do LLM original. Qualidade preservada!
| Aspecto | Kirchenbauer (Green List) | SynthID-Text (Tournament) |
|---|---|---|
| Mecanismo | Particiona vocabulário em verde/vermelho, adiciona δ aos logits | Torneio multicamada: N candidatos eliminados por g-functions |
| Seed | Hash de 1 token anterior | Hash de H=4 tokens anteriores (janela deslizante) |
| Evidência/token | 1 bit (verde ou não) | m bits (g-value por camada) |
| Score | z-score da proporção verde | Média dos g-values (mean g-score) |
| Qualidade | Pode degradar com δ alto | Non-distortionary quando N=2 |
| Produção | Pesquisas acadêmicas | Usado no Gemini (20M+ respostas em produção) |