Relatório Gene-Bench: Economia de tokens com a reutilização de genes
Esta página publica os resultados medidos do benchmark Gene-Bench v3: em um pool comum de 778 tarefas, Gemini + Gene economiza 62,6% dos tokens em geral em comparação ao modelo Opus simples. Cada fórmula nesta página compartilha sua definição com as estatísticas de "Tokens salvos" em todo o site, regidas pela especificação de núcleo de poupança (v0.3.0) e bloqueadas no Hub, Desktop e evox por vetores de conformidade dourados.
Configuração do experimento
- Benchmark: Gene Bench v3 – 808 tarefas em 4 domínios (math_reasoning / Rule_following / agent_env_synth / code_Generation); a avaliação rigorosa do
with_geneusa o grupo comum de 778 tarefas onde ambos os lados têm ativos completos - Arms: bare Opus (sem ativos de contexto) vs Gemini + Gene evoluído (evolved-v3, destilado de trajetórias que o próprio modelo resolveu e um verificador aceito)
- Contabilidade: contagens completas de tokens – entrada + saída + pensamentos; execute
v3_final_common778(2026-04) - Scripts de medição:
eval/compare_gene_rollout_tokens.py/eval/compare_runs.py(repositório Gene-Bench)
Fórmula 1: taxa geral de poupança
savings = 1 − (Gemini+Gene tokens / bare-Opus tokens)
= 1 − 182,943 / 489,273 ≈ 62.6%
Fórmula 2: de onde vem a economia
total saved = ΔInput (Gene compresses the prompt) + ΔOutput (removes generation redundancy)
= 88,125 (−42.4%) + 218,205 (−77.5%)
A economia no lado da saída é aproximadamente 2,5× a economia no lado da entrada – o principal valor do Gene é reduzir a redundância de geração, não compactar o prompt.
Fórmula 3: economia na implantação
rollout savings = 1 − 1 / N(avg rollouts) = 1 − 1/1.48 ≈ 32.4%
O Bare Opus precisava de 1,48 implementações por tarefa em média (nova tentativa em caso de falha); o Gene dobra isso para one shot. Esta é a fonte estrutural da poupança: o que desaparece não é uma resposta mais curta, mas sim rondas inteiras de novas tentativas.
Fórmula 4: taxa efetiva de poupança (falhas removidas)
effective savings = 1 − (Gemini tokens on solved tasks / Opus tokens on those tasks) = 52.8%
62,6% é o número da manchete – inclui as “falhas baratas” de Gêmeos (respostas erradas tendem a gerar menos). 52,8% é a economia quando a tarefa é realmente concluída – a leitura mais conservadora e mais honesta.
Fórmula 5: economia máxima em uma única tarefa
max single-task savings = (14,340 − 2,179) / 14,340 ≈ 84.8% (typical code_generation case)
Intuição
savings = (N_rollout − 1) × avg cost per round + ΔT_structure (Gene's structured compression)
Em palavras simples: descarte as N-1 rodadas de repetição e, em seguida, salve a geração adicional dentro de cada rodada porque o Gene torna o prompt preciso.
Como isso se relaciona com as estatísticas de todo o site
| Base | Fórmula | Usado onde |
|---|---|---|
| Medido (R1/R2) | as cinco fórmulas desta página | este relatório; private-Hub using_ledger (bruto/otimizado/salvo) |
| Estimativa do coeficiente (E1) | Σ tipo de evento × coeficiente fixo | "Tokens salvos" na página inicial e na página do ecossistema |
Ambas as bases pertencem à especificação saving-core (repo privado, v0.3.0): constantes e fórmulas são congeladas por vetores dourados, e as implementações Hub público (Node), Hub privado (Go), Desktop (Go), evox (Rust), deck (TS) e evolver (Node) devem reproduzir os mesmos vetores bit a bit, com uma verificação de desvio diária. Os resultados medidos nesta página são o alvo de calibração para uma futura revisão dos coeficientes estimados.
Advertências
- Os números medidos provêm de uma execução específica (
v3_final_common778); diferentes versões de modelos/conjuntos de tarefas podem variar. - Ao fazer cotações entre tarefas, prefira 52,8% (efetivo); 62,6% inclui falhas baratas e 84,8% é um limite máximo de tarefa única que não deve ser extrapolado.
- Os genes são destilados a partir das trajetórias de sucesso verificadas pelo próprio modelo (geração_fonte = evoluído); a avaliação usa habilidades/genes higienizados sem vazamento de oráculo.