Simulador SynthID-Text

Implementação interativa do método de Dathathri et al. (2024) — Tournament Sampling para marca d'água em LLMs. Gere texto via Ollama e visualize o torneio, g-values e detecção em tempo real.
Conexão
Aguardando conexão...
Prompt
Parâmetros SynthID-Text
Mais camadas = mais evidência por token
2 = non-distortionary
Tokens anteriores p/ seed
Geração
Configure a conexão com o Ollama, ajuste os parâmetros do torneio e clique em "Gerar com SynthID-Text".

A visualização mostra o bracket do torneio para cada token,
a matriz de g-values e o score de detecção acumulado.

Como funciona a SynthID-Text (Tournament Sampling)

1

Seed Aleatória

Um hash dos últimos H tokens (janela deslizante) + chave secreta gera a seed rt para cada posição.

2

Amostragem de Candidatos

Sample Nm tokens da distribuição do LLM. Estes são os participantes iniciais do torneio.

3

Torneio Multicamada

Cada camada ℓ usa uma g-function independente g(token, seed) para eliminar candidatos. Sobram Nm-ℓ a cada rodada.

4

Vencedor = Token Gerado

O último sobrevivente do torneio é o token xt. Seus g-values ao longo das camadas formam a "assinatura" da marca d'água.

Detecção (Scoring)

Para detectar: calcula-se a média de todos os g-values do texto. Texto marcado terá média > 0.5 (esperado ~0.5 para não-marcado). Quanto mais tokens e camadas, maior a evidência estatística.

Score = (1/(T·m)) · Σt,ℓ g(xt, rt)

Não-Distorção

Quando N=2 (dois candidatos por match), o Tournament é single-token non-distortionary: em média, a distribuição de saída é idêntica à do LLM original. Qualidade preservada!

N=2 → não-distorção → qualidade preservada
N>2 → distorção → maior detectabilidade
Comparação: SynthID-Text vs Kirchenbauer (Green List)
Aspecto Kirchenbauer (Green List) SynthID-Text (Tournament)
Mecanismo Particiona vocabulário em verde/vermelho, adiciona δ aos logits Torneio multicamada: N candidatos eliminados por g-functions
Seed Hash de 1 token anterior Hash de H=4 tokens anteriores (janela deslizante)
Evidência/token 1 bit (verde ou não) m bits (g-value por camada)
Score z-score da proporção verde Média dos g-values (mean g-score)
Qualidade Pode degradar com δ alto Non-distortionary quando N=2
Produção Pesquisas acadêmicas Usado no Gemini (20M+ respostas em produção)