Gene-Bench 実測レポート:Gene 再利用によるトークン削減
本ページは Gene-Bench v3 ベンチマークの実測結果を公開します。778 タスクの共通プールにおいて、Gemini + Gene は素の Opus モデルに対し全体で 62.6% のトークンを削減しました。本ページのすべての式はサイト全体の「削減トークン」統計と同一の定義を共有し、savings-core 仕様(v0.3.0)が統括、Hub・Desktop・evox 間でゴールデンベクトルにより整合性が固定されています。
実験設定
- ベンチマーク:Gene Bench v3 -- 4 ドメイン(math_reasoning / rule_following / agent_env_synth / code_generation)808 タスク。厳密な
with_gene評価は両側の資産が揃う 778 タスク共通プールを使用 - 比較対象:素の Opus(コンテキスト資産なし) vs Gemini + 進化済み Gene(evolved-v3。モデル自身が解き、verifier が承認した軌跡から蒸留)
- 集計方法:input + output + thoughts の全トークン;run
v3_final_common778(2026-04) - 測定スクリプト:
eval/compare_gene_rollout_tokens.py/eval/compare_runs.py(Gene-Bench リポジトリ)
式 1:全体削減率
削減率 = 1 − (Gemini+Gene トークン / 素の Opus トークン)
= 1 − 182,943 / 489,273 ≈ 62.6%
式 2:削減の二つの源泉
総削減 = ΔInput(Gene がプロンプトを圧縮) + ΔOutput(生成の冗長を除去)
= 88,125 (−42.4%) + 218,205 (−77.5%)
Output 側の削減は Input 側の約 2.5 倍 -- Gene の主な価値は入力の圧縮ではなく、モデルの生成冗長の削減にあります。
式 3:Rollout 折りたたみによる削減
Rollout 削減 = 1 − 1 / N(平均 rollout 回数) = 1 − 1/1.48 ≈ 32.4%
素の Opus はタスクあたり平均 1.48 回の rollout(失敗時の再試行)が必要でしたが、Gene はこれを 1 回に折りたたみます。これが削減の構造的源泉です:消えるのは短い回答ではなく、再試行のラウンドそのものです。
式 4:有効削減率(失敗タスクを除外)
有効削減率 = 1 − (正解タスクの Gemini トークン / 同タスクの Opus トークン) = 52.8%
62.6% は見かけの数字で、Gemini が誤答した際の「安価な失敗」(誤答は生成量が少ない傾向)を含みます。タスクを実際に完了した場合の削減は 52.8% -- より保守的で誠実な読み方です。
式 5:単一タスクの最大削減
単一タスク最大削減 = (14,340 − 2,179) / 14,340 ≈ 84.8% (code_generation の典型例)
直感的な理解
削減 = (N_rollout − 1) × ラウンドあたり平均コスト + ΔT_structure(Gene の構造化圧縮)
平たく言えば:再試行の N−1 ラウンドを丸ごと省き、さらに各ラウンド内でも Gene がプロンプトを精密にするぶん生成量が減る。
サイト全体の統計との関係
| 基準 | 式 | 使用箇所 |
|---|---|---|
| 実測(R1/R2) | 本ページの五つの式 | 本レポート;プライベート Hub の usage_ledger(raw/optimized/saved) |
| 係数推定(E1) | Σ イベント種別 × 固定係数 | トップページとエコシステムページの「累計削減トークン」 |
両基準とも savings-core 仕様(プライベートリポジトリ、spec v0.3.0)に属します:定数と式はゴールデンベクトルで凍結され、公開 Hub(Node)・プライベート Hub(Go)・Desktop(Go)・evox(Rust)・deck(TS)・evolver(Node)の各実装が同一ベクトルをビット単位で再現することを毎日の drift-check が監視します。本ページの実測結果は、将来の推定係数キャリブレーションの基準点です。
注意事項
- 実測値は特定の run(
v3_final_common778)によるもので、モデルバージョンやタスクプールが異なれば変動します。 - タスク横断で引用する場合は **52.8%(有効削減率)**を優先してください。62.6% は安価な失敗を含み、84.8% は単一タスクの上限であり全体に外挿できません。
- Gene はモデル自身の検証済み成功軌跡から蒸留(generation_source = evolved)。評価にはオラクル漏えいのないサニタイズ済み Skill/Gene を使用しています。