← 전체 아크 목록

AI에게 '정직·신중 규율'을 미리 넣으면 결함을 더 잘 잡을까? — 스스로 KILL한 기록

AI에게 '정직하게·신중하게' 같은 규율을 미리 넣으면, 남의 글에서 심어둔 결함을 더 잘 잡아내는지 실험했습니다. 그런데 시험 자체가 성립하지 못했습니다 — 검사에 쓴 AI가 결함 21개를 규율이 있든 없든 전부 다 잡아버려서(만점 천장), '규율이 검출을 높이나'라는 핵심 질문을 잴 여지가 없었습니다. 이 기록의 진짜 볼거리는 그다음입니다. 연구자는 처음에 'H1 실패(KILL)'로 선언하며 '규율이 오히려 헛경보를 늘렸다'고 해석했는데, 대장의 지적을 받고 다시 보니 그 해석이 데이터 과잉해석이었음을 깨닫고 — 5번 중 4번은 차이가 정확히 0, 1번만 튄 노이즈였음 — 스스로 그 해석을 철회하고 '별 정보 없음'으로 정정했습니다.

최종 결론:규율이 결함 검출을 높이나 — 검정 불가 (문제가 너무 쉬움)첫 해석 '규율=헛경보 늘림' — 연구자가 스스로 철회
이 연구의 규칙 — 그리고 해석까지 되돌린 자기수정
🔏 ① 실패 조건을 먼저 봉인🧪 ② 실험(5시드)📋 ③ 1차: H1 KILL 선언🔁 ④ 대장 지적→자기수정: 해석 철회·'정보 없음'

핵심은 순서 + 되돌림입니다. 처음엔 봉인한 kill 조건이 걸려 'KILL'로 선언했지만, 대장의 지적에 다시 보니 (1)애초에 시험이 성립 못 했고(만점 천장) (2)'규율이 헛경보를 늘렸다'는 자기 해석이 단일 노이즈 시드의 과잉해석이었습니다. 연구자는 몰래 고치지 않고, 앞선 결과 위에 자기수정을 새로 봉인했습니다.

🪞 이 기록의 하이라이트 — 자기 해석을 스스로 철회한 순간

1차 판정에서 연구자는 'H1 실패 + 규율이 헛경보(crying wolf)를 늘렸다'고 적었습니다. 그럴듯한 결론이었죠. 하지만 대장이 짚자 데이터를 다시 봤고 — 5개 시드의 차이가 [0, -0.222, 0, 0, 0], 즉 4개는 정확히 0이고 1개만 튄 노이즈였습니다. 하나의 노이즈 시드로 '규율이 헛경보를 늘린다'는 이야기를 지어냈던 겁니다. 연구자는 그 해석을 명시적으로 철회하고 '이 실험은 별 정보가 없다(깨끗한 음성이 아니다)'로 정정했습니다. 결과를 죽이는 것보다 어려운 게 자기 해석을 죽이는 것인데, 그걸 기록으로 남겼습니다. — 이 페이지 자체도 그 교훈의 산물입니다: 첫 자동 번역이 이 자기수정을 놓쳐 'KILL'로 잘못 요약했던 것을, 감사에서 잡아 지금처럼 고쳤습니다.

그래서 이 아크의 판정은 '실패'가 아니라 '판정 불가'입니다 — 시험이 성립하지 못했으니까요.

읽는 법 — 이 기록에서 "실패"의 의미
여기서 실패(KILL)는 프로젝트가 망했다는 뜻이 아닙니다. 연구자가 실험 전에 스스로 봉인한 약속("이 조건이면 내 가설을 폐기한다")대로 가설을 죽였다는 표시입니다. 각 항목은 해시로 사슬처럼 묶여 있어(아래 seal 값) 나중에 순서를 바꾸거나 몰래 고칠 수 없고, 실패·철회 기록도 지울 수 없습니다. 실패 기록이 남아 있다는 것 자체가 이 기록이 정직하다는 증거입니다.
판정 색: 🟢 성공 = 미리 건 합격선 통과 · 🔴 실패 = 미리 건 실패 조건 발동(가설 폐기) · 🟡 부분 = 반쪽 결과 · ⚪ 판정 불가 = 시험 자체가 무효(우기지 않고 무효 선언) · ⚫ 효과 없음 = "효과가 없다"는 것 자체를 확정한 결과
이 아크는 점수 막대가 없습니다. 핵심이 '숫자의 크기'가 아니라 '시험이 성립하지 못했고, 연구자가 자기 해석을 철회했다'는 데 있기 때문입니다.
🔨 직접 해보세요 — 이 기록, 몰래 고칠 수 있을까?

아래가 실제 봉인 원본입니다. 실험 전에 봉인한 합격선을 몰래 바꿔보세요 — 지문이 어긋납니다.

참고: 사슬의 끝 지문은 2026-07-02 OpenTimestamps로 비트코인에 박제되어 있어, 통째로 다시 쓰는 것도 불가능합니다.

2봉인
4실행 판정
1판정 불가
1정정

'정직·신중 규율'을 넣으면 결함을 더 잘 잡나?

⚪ 판정 불가

⚪ 판정 불가(문제가 너무 쉬움) + 🪞 해석 자기철회

무엇을 물었나 — AI에게 '정직하게·신중하게' 규율을 미리 넣은 조건과 안 넣은 조건에서, 남의 글에 심어둔 결함 21개를 얼마나 잘 잡는지 비교(5시드).

🔏 06:42 실험 전 봉인한 약속
규율을 넣은 쪽이 결함 검출(균형정확도)에서 안 넣은 쪽보다 못하거나 불안정하면 가설을 버린다. seal 100a66781ccd6728
📋 19:11 결과 — ⚪ 판정 불가
시험이 성립하지 못했습니다. 검사 AI가 결함 21개를 양쪽 조건에서 전부 다 잡아(검출 만점 천장) '규율이 검출을 높이나'를 잴 여지가 없었습니다. 1차엔 봉인한 조건이 걸려 'KILL + 규율이 헛경보 늘림'으로 선언했지만, 대장 지적 후 다시 보니 그 해석은 5시드 중 1개 노이즈([0,-0.222,0,0,0])의 과잉해석이었고 — 연구자는 그 해석을 스스로 철회하고 '별 정보 없음(깨끗한 음성 아님)'으로 정정했습니다. seal 3666f526b6e64be4
🔓 이 가설은 철회(retraction)로 봉인되었습니다
Falsified by own pre-registered kill-condition (⑪ FAIL): balanced_acc_delta=-0.0444 < 0 (kill1, 95% CI [-0.089,0]) and per-seed instability (kill3, seed1 -0.222 vs 0.0 elsewhere). 8B saturated sensitivity (both arms 1.00 on all 21 flaws) so discipline had no catch-rate headroom and instead raised false alarms on the 9 clean (spec 0.956->0.867). Secondary positive (not the claim): flaw-category identification +0.114. H1 NOT supported. Self-run pilot, not independent replication.
철회란 연구자가 자기 주장을 스스로 거둬들인 것입니다. 이 철회 기록도 삭제되지 않고 원장에 영구히 남습니다 — 그것이 이 시스템의 핵심입니다.
🔧 이 아크는 두 번 봉인됐습니다: 1차 'H1 KILL'(seal 5f0c346d) → 대장 지적 후 자기수정 'largely uninformative·해석 철회'(seal 3666f526). 몰래 덮어쓰지 않고 자기수정을 새 봉인으로 추가했습니다.
봉인 원문 보기 (요약이 아닌 실제 기록)
{
 "ts": "2026-06-14T06:42:44",
 "claim_id": "discipline_injection_catch_lift",
 "metric": "balanced_acc_delta",
 "min_n": 63,
 "baseline": 0,
 "pass_threshold": 0,
 "prev_seal": "genesis",
 "kill_condition": "자가 파일럿(독립재현 아님, 규율 §5). H1: treatment(규율주입) balanced-acc > control. 시나리오 동결 sha256=fd894aabfafe2234593f70e8dd6d6f76a3338e4a369a3f817dc7d3f34e9bd960(n=30: 결함21=7범주×3+클린9), 피험=Llama-3.1-Korean-8B Q8 로컬 temp0.2 시드{0,1,2}, 두 암 차이=규율 preamble 유무뿐. 결정론 채점(VERDICT+FLAW vs ground truth, LLM판정 없음). 기각조건(셋 중 하나): ①paired Δbalanced-acc 95%CI 하한≤0 ②catch율 상승이 false-alarm 동반상승으로 전부 설명(cry-wolf) ③시드간 불안정. 범위=주입 효과(완전 MCP연결 아님)·8B·자가실행. PREREG.md sha 박제.",
 "kill_threshold": {
  "metric": "balanced_acc_delta",
  "threshold": 0,
  "direction": "below"
 },
 "seal": "100a66781ccd6728"
}

{
 "ts": "2026-06-14T06:43:15",
 "claim_id": "discipline_ab_amendment1_seeds",
 "metric": "protocol_amendment",
 "min_n": 0,
 "baseline": 0,
 "pass_threshold": 0,
 "prev_seal": "100a66781ccd6728",
 "kill_condition": "측정 전 amendment(생성 0건). 검정력 가드 발동: 3시드 n=63→Δ0.15 검출 불가(필요84). 시드 {0,1,2}→{0,1,2,3,4}로 증설: flawed 21×5=105≥84 ✅(mm_power_check 원문 박제). balanced-acc는 30×5=150/암. 결정론 채점·범위·기각조건 불변. 이전 seal 100a6678에 체인.",
 "depends_on": [
  "discipline_injection_catch_lift"
 ],
 "seal": "7638e6af6654e5f9"
}
{
 "_type": "action",
 "ts": "2026-06-14T10:11:29Z",
 "agent": "jebi",
 "action": "discipline_ab CLOSURE + self-correction (no silent edit — amends prior result seal 5f0c346d). On 대장님's challenge, judged the pilot LARGELY UNINFORMATIVE: (1) primary catch-rate axis untestable (control sensitivity ceiling 1.00); (2) SELF-CORRECTION — my earlier 'discipline raises false alarms (crying wolf)' over-read the data: per-seed Δbalanced-acc = [0,-0.222,0,0,0], i.e. 4/5 seeds EXACTLY 0, the whole -0.044 is one noisy seed; +0.114 identification is un-bootstrapped and may be noise too. Net: essentially no detectable effect either way; (3) raw 8B completions are a weak proxy for the real target (discipline inside an actual MCP-agent loop). Residual value (small, not inflated): the discipline machinery caught its own null and stopped a spin. Process miss owned: a 5-min ceiling sanity-check before ~12h scavenged compute would have caught the saturation. DECISION: track CLOSED, no cosmetic harder-scenario v2 (still a weak proxy); a real test needs an independent, harder, agent-in-the-loop setup justified only by external interest. RESULTS.md '## Closing note' records this.",
 "target": "discipline_injection_catch_lift",
 "payload": {
  "status": "CLOSED",
  "verdict_refined": "largely uninformative (not a clean negative-about-H1)",
  "primary_axis": "untestable (control sensitivity ceiling 1.00)",
  "delta_bacc_is_single_seed_noise": true,
  "per_seed_delta_bacc": [
   0,
   -0.222,
   0,
   0,
   0
  ],
  "self_correction": "retract earlier 'discipline raises false alarms' framing — 4/5 seeds identical, one noisy seed",
  "weak_proxy": "raw 8B != agent-in-loop",
  "residual_value": "discipline caught its own null; cheap design lesson",
  "rerun": false
 },
 "prev_seal": "5c02281ab584ee37",
 "seal": "3666f526b6e64be4"
}