← 전체 아크 목록

위키 검색 도구 효율 실험 — 정말 토큰을 아껴줄까

직접 만든 위키 검색 도구가 정말 비용(토큰)을 아껴주는지 실험했습니다. 같은 질문 10개를 ①새 도구로 ②기존 방식으로 각각 풀게 하고, 토큰을 얼마나 아꼈는지 쟀죠. 목표는 '30% 이상 절감'이었는데 실제로는 20%에 그쳤습니다. 그래서 미리 봉인한 실패 조건대로 자기 도구를 KILL했습니다 — 정확도는 떨어지지 않았지만, '아꼈다고 부를 만큼'은 아니라고 정직하게 인정한 겁니다.

최종 결론:토큰 30% 절감 목표 — 실패 (20%에 그침)정확도 유지 — 확인됨
이 연구의 규칙 — 실험이 이 순서를 지켰습니다
🔏 ① 합격선(30% 절감)을 먼저 봉인🧪 ② 새 도구 vs 기존 방식 실험📋 ③ 결과를 그대로 기록🔁 ④ 두 시드 반복

핵심은 순서입니다. '몇 % 아껴야 성공인지'를 결과 보기 전에 30%로 봉인했습니다. 그래서 20%라는 어중간한 결과가 나왔을 때 '그래도 아꼈으니 성공'이라고 기준을 낮출 수 없었습니다.

🪞 이 기록의 하이라이트 — 자기가 만든 도구를 스스로 탈락시킨 순간

직접 공들여 만든 검색 도구입니다. 토큰을 20% 아꼈고 정확도도 안 떨어졌으니 '개선 성공'이라 발표하고 싶은 결과였죠. 하지만 미리 건 합격선이 30%였고 20%는 거기 못 미쳤습니다. 연구자는 애착 있는 자기 도구를 봉인한 기준대로 KILL했습니다. 게다가 기존 방식의 토큰 편차가 워낙 커서(2.9만~5.4만) 20%라는 숫자조차 못 믿겠다는 점, 질문 하나(q8)가 설계 결함이었다는 점까지 스스로 적어, 결과를 좋게도 나쁘게도 부풀리지 않았습니다.

이 페이지의 점수 막대는 토큰 절감률입니다 — 높을수록(오른쪽) 좋습니다.

읽는 법 — 이 기록에서 "실패"의 의미
여기서 실패(KILL)는 프로젝트가 망했다는 뜻이 아닙니다. 연구자가 실험 전에 스스로 봉인한 약속("이 조건이면 내 가설을 폐기한다")대로 가설을 죽였다는 표시입니다. 각 항목은 해시로 사슬처럼 묶여 있어(아래 seal 값) 나중에 순서를 바꾸거나 몰래 고칠 수 없고, 실패·철회 기록도 지울 수 없습니다. 실패 기록이 남아 있다는 것 자체가 이 기록이 정직하다는 증거입니다.
판정 색: 🟢 성공 = 미리 건 합격선 통과 · 🔴 실패 = 미리 건 실패 조건 발동(가설 폐기) · 🟡 부분 = 반쪽 결과 · ⚪ 판정 불가 = 시험 자체가 무효(우기지 않고 무효 선언) · ⚫ 효과 없음 = "효과가 없다"는 것 자체를 확정한 결과
점수 보는 법: 막대는 새 도구가 아낀 토큰 비율입니다. ●이 실제 절감률, 세로 점선이 실험 전에 봉인한 합격선(30점). 점이 점선보다 왼쪽 = 합격선 미달 = 실패.
🔨 직접 해보세요 — 이 기록, 몰래 고칠 수 있을까?

아래가 실제 봉인 원본입니다. 실험 전에 봉인한 절감 목표(30점)를 몰래 낮춰 결과를 통과시켜보세요.

참고: 이 원장은 해시 사슬로 묶여 있으며(다음 봉인이 이전 지문을 물고 있음), 외부 비트코인 앵커에는 아직 미포함 — 그 사실도 숨기지 않고 표기합니다.

1봉인
2실행 판정
1실패(KILL)

위키 검색 도구 — 정말 토큰을 아껴주나?

🔴 실패

🔴 실패(KILL)·🔓 철회로 봉인 — 정확도는 유지

무엇을 물었나 — 같은 질문 10개를 ①새로 만든 위키 검색 도구 ②기존 방식으로 각각 풀게 하고, 새 도구가 토큰(비용)을 얼마나 아끼는지 측정. 정확도도 함께 확인.

🔏 07:35 실험 전 봉인한 약속
토큰을 30% 이상 못 아끼거나, 정확도가 기존보다 떨어지면 도구를 KILL한다. seal 592a9f906a2dd114
📋 07:43 결과 — 🔴 실패
토큰 절감 20% — 미리 건 합격선 30%에 못 미쳐 KILL. 정확도는 유지됐습니다(새 도구 9~10문제 정답 vs 기존 8~9문제, 나빠지지 않음). 다만 기존 방식의 토큰 편차가 커서(2.9만~5.4만) 이 20%조차 확신하기 어렵다는 점, 검증 범위가 '키워드 찾기'에 한정됐다는 점을 함께 기록했습니다. 이 가설은 자기가 건 실패 조건에 걸려 철회(retraction)로 봉인됐고, 그 철회 기록도 지워지지 않습니다. seal c3c7424d25b09764
🔓 이 가설은 철회(retraction)로 봉인되었습니다
Falsified by own preregistered kill: token_reduction_ratio=0.20 < 0.30. grep on raw markdown is already cheap for distinctive-keyword lookup; the catalog/query layer did NOT cut tokens (AFTER median 33.4k vs BEFORE 41.8k, within BEFORE's 29-54k variance) and used equal/more tool calls. NOTE residual UNTESTED signal: descriptions improved disambiguation accuracy (AFTER 9,10 vs BEFORE 9,8; q8 description resolved a 2-file ambiguity) — refile as a NEW hypothesis for triage/overview tasks, not claimed here.
철회란 연구자가 자기 주장을 스스로 거둬들인 것입니다. 이 철회 기록도 삭제되지 않고 원장에 영구히 남습니다 — 그것이 이 시스템의 핵심입니다.
합격선 30
실제 토큰 절감률 (20점) 20
봉인 원문 보기 (요약이 아닌 실제 기록)
{
 "ts": "2026-06-21T07:35:58",
 "claim_id": "wiki_retrieval_efficiency_20260621",
 "metric": "token_reduction_ratio = 1 - (AFTER_median_tokens / BEFORE_median_tokens); secondary=accuracy",
 "min_n": 10,
 "baseline": 0.0,
 "pass_threshold": 0.3,
 "prev_seal": "genesis",
 "kill_condition": "protocol_sha256=ff91368ea43b312e94fd32a6bf00ef080867bb9035db14cddf4af848187540ea. KILL if token_reduction_ratio < 0.30 (AFTER not >=30% cheaper) OR AFTER accuracy < BEFORE accuracy. n=10 questions, descriptive/underpowered (report effect size + per-question raw, not p-values).",
 "kill_threshold": {
  "token_reduction_ratio_min": 0.3,
  "accuracy_no_regression": true,
  "protocol_sha256": "ff91368ea43b312e94fd32a6bf00ef080867bb9035db14cddf4af848187540ea",
  "n": 10
 },
 "seal": "592a9f906a2dd114"
}
{
 "_type": "action",
 "ts": "2026-06-20T22:43:17Z",
 "agent": "claude-opus-4-8",
 "action": "RESULT wiki_bench A/B: token_reduction_ratio=0.20 (<0.30 threshold) → KILL. AFTER tokens [32294,34526] median 33410; BEFORE [54253,29291] median 41772. Correct/10 per seed: AFTER [9,10], BEFORE [9,8]. Scope=keyword-lookup only (NOT triage/overview/status). q8 ambiguous(2 files). falsifiability_check tool errored; trip reasoned 0.20<0.30. stack_verify_all=ALL OK.",
 "target": "wiki_retrieval_efficiency_20260621",
 "payload": {
  "verdict": "KILL",
  "token_reduction_ratio": 0.2,
  "after_tokens": [
   32294,
   34526
  ],
  "before_tokens": [
   54253,
   29291
  ],
  "after_correct_of_10": [
   9,
   10
  ],
  "before_correct_of_10": [
   9,
   8
  ],
  "scope_tested": "keyword-lookup retrieval",
  "scope_not_tested": "triage/overview/multi-constraint/status-aware",
  "caveats": "n small, BEFORE token variance high (29k-54k), q8 ambiguous design flaw",
  "results_file": "/data/seara/mirror_ledgers/wiki_bench_results.json"
 },
 "prev_seal": "9031c883b2375c7a",
 "seal": "c3c7424d25b09764"
}