작업이 남긴 판단의 기록.
AI 모델 평가, 에이전트 하네스 설계, 지식관리 시스템 운영에서 나온 리포트를 공개합니다. 각 글은 실측과 근거 라벨을 갖춘 작업 산출물입니다.
모델 5편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
모델 리프레시 캠페인 · Fable 상시화와 5.6 재측정
"Fable이 곧 사라진다"는 두 달의 전제가 7/20 Max·Team Premium 플랜 상시 포함(한도 50%)으로 뒤집힌 사흘의 기록. 딥리서치(검증 단계 레이트리밋 전멸 → 1차 출처 직접 재확인)로 지형을 고정하고(리더보드 fable 2위·sol 3위, 소넷5 특가 8/31 한정, 신형 토크나이저 +30%) 레이스를 완주: ① 빌드·QA N=3에서 5.6-luna-low가 게이트 동률·비용 −83%로 전 축 승자(keystone#307 등록), ② sol의 author-h 3/3은 확인 런 1/3 미재현으로 철회. author-h의 run간 변동성(전 모델 진동)을 발견하고 "in-run 비교 전용" 규약 확정, ③ 기획 축 청정 재측정에서 소넷5가 오푸스4.8을 우세(pass^3 2/2 vs 1/2·비용 −60%). #229 재검 초안 작성. 런 사망 2회·오염 1회에서 PLAYBOOK 수칙 4(caffeinate 분리 실행·스로틀 창 무효)가 나왔고, 적대 리뷰 게이트가 오염 런의 latest 승격을 차단한 실사례 포함.
모델을 고르고, 바꾸고, 못 바꾸게 하기
2026-07-11 하루의 실제 작업을 쉬운 서사로 정리. codex 인증이 막힌 진짜 원인(기본 브라우저가 엉뚱한 계정으로 조용히 로그인)과 프로필 지정 해결, GPT-5.6 Terra·Luna 스크리닝(변별 4과제 8/8 통과, 5.5-low 대비 거의 동률), 티어의 본질(속도가 아니라 능력 등급+가격), "자동 모델 라우터" 오픈소스의 공급망 감사(숨은 지시문 발견 → discard), 그리고 왜 모델 교체를 자동으로 안 하도록 2겹 승인 게이트를 뒀는지까지 관통.
모델 티어 품질 축 완주
regatta 27셀(3항목×변별 3과제×3반복) 완주. 첫 "결정 인용 가능" 데이터. 품질 동률에서 gpt-5.5-low가 토큰 −62%·시간 −75% 양축 지배, N=1의 "최속 haiku-low" 순위가 반복 측정에서 뒤집힘. propose 브릿지 첫 가동 → keystone-hub #219 등록.
모델 티어 재측정 · 오늘의 델타
7/8 예약 재측정을 3일 앞당겨 Opus 4.8로 실측. substrate 불변식 Δ0(모델 비종속 실증), 적대 리뷰 훅 래핑 드리프트 발견, 품질 축은 429 스로틀로 미측정.
모델 티어 등화 검증
모델 성능 차이와 하네스/스캐폴드 효과를 분리해, 어떤 작업을 고급 모델에 라우팅해야 하는지 검증한 리포트.
리뷰 1편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
제품에서 시스템으로
커밋 3,275건을 세 군으로 나눠 읽은 7개월의 작업 궤적. 제품군이 상반기를 지배하다 하네스·측정으로 무게중심이 옮겨가는 과정을 추적하고, 반복된 동작에서 작업 원칙과 그 이면의 긴장을 역산한다. 분석이 세 번 뒤집힌 이력도 함께 싣는다.
운영 1편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
운영 로드맵
운영 체계의 현재 좌표, 상시 가동 중인 자동화 11개, 다음 12개월의 실행 순서를 정리한 전략 리포트. 결론은 "무엇을 더 만들까"가 아니라 이미 설계된 것의 회수와 종결이며, 절반은 하지 않을 것의 목록이다.
철학 1편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
비교→개선 루프의 기록
아카이브된 ai-rules 저장소(368커밋, 2026-02-28~07-03)의 docs 자산에서 "비교가 로드맵이 되고 로드맵이 재평가로 검증되는 루프"를 복원한 전기. 철학 세 기둥의 도입 커밋 추적(신뢰도 레이블은 첫날부터, R0~R2는 04-01, HARD STOP은 오히려 후기 산물), ai-rules(당시) vs keystone-hub(현재) 6축 대비 패널(문서 주입→결정론 게이트 50종, 양방향 sync→단방향 apply, 일회성 비교→상시 수확 루프), 4월 비교 러시 타임라인(커밋 313/368이 4월 집중), 9차원 자평 26/45에서 P1~P19 하루 구현 커밋 체인, 같은 날 Before/After 재평가 3종(B→A, 87→95 역전 선언과 그 자체 평가 한계 병기), 05-31 이관·아카이브 서사까지. 2편(7종 재평가)의 서론.
하네스 7편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
2026-08 재평가
2026-04에 ai-rules가 비교했던 오픈소스 7종(Superpowers·ECC·Claude Code 공식·GSD·Hermes·Codex CLI·커뮤니티 훅 5종)을 전부 최신 재조사하고, keystone-hub 현재 기준으로 재판정한 3점 측정 리포트. 섹션마다 "04 판정 | 08 재조사 | keystone 재판정" 3단 패널. 주요 발견: Superpowers는 경쟁자에서 플러그인 부품으로(268.8K★, 로컬 캐시는 3개월 뒤처짐), ECC는 Harness OS 리브랜딩과 첫 표면 축소 신호, 공식 CC는 100릴리스로 서드파티 차별점 대거 흡수(남은 몫: cross-CLI 정본·규칙 콘텐츠·드리프트 흡수), GSD 원본 사망과 커뮤니티 포크(1인 관리자 리스크 실증), Hermes 자가개선 축의 "거부→게이트 뒤 수용" 진화, Codex /import의 수렴 압력, 훅 생태계 양극화. 종합 파노라마 표와 다음 루프 후보 5건(플러그인 세대 갱신, 공식 흡수분 재범위화 등)으로 마무리.
머신 셋, 설정 하나
impeccable 디자인 스킬 평가(skill-judge A등급)에서 출발해 "좋은 스킬을 어디까지 켜둘 것인가"로 번진 실사례 기록. 공식 레버 3종 해부(disable-model-invocation은 description 자체가 컨텍스트에서 빠져 토큰까지 절약 · enabledPlugins의 user/project/local 스코프 · 카탈로그 아카이브), 이 환경 고유의 함정 실측(CLI 토글은 apply가 레이어 시드로 되돌림, runtime-preserve는 model 키 1개뿐, apply.sh:559). 커뮤니티 실태를 3층으로 정리: 1층 동기화 안 함+프로젝트 스코프 회피 / 2층 파워유저 표준 = ~/.claude의 git 정본화(chezmoi·plain git·NAS symlink·전용 CLI 4변형 비교, 검색 상위 가이드 8건 전부 이 층) / 3층 기업 managed settings MDM. keystone은 2층 자체 구현이고 chezmoi 개념과 1:1 동형표(source state↔layers, hostname 템플릿↔4프로파일, apply↔apply.sh, doctor↔keystone-doctor) + 동형이 아닌 두 지점(adapter export, runtime-preserve 역방향 예외), 패턴은 표준·무게는 예외라는 위치 판정. chezmoi 이점 5종과 Claude Code 기준 최소 사용 루프, keystone 판정: 전환 비권장·채굴 3건(age 선별 암호화, 명시적 제외 선언 파일, 세션 훅 pull). 결론 3개 각각에 반론과 반증 조건 병기: apply發 사고 2회+면 chezmoi 이관 RFC, 프로젝트 enable 3repo+면 포크안 전환, 채굴 미등록 시 판정 재심사. 부수 실행: keystone PR #454(3줄 diff)로 impeccable 전역 off+텔레메트리 opt-out, 플러그인 3.1.1→4.0.4.
양자를 빌려 쓰는 법
물리 개념을 소프트웨어로 가져오는 일을 "된다/안 된다"가 아니라 건너오는 층위로 나눠 심사한 기록. 층위① 용어: 벡터 quantization은 물리(에너지 준위 이산화)와 어원 계보만 공유하는 수치 기법이라 이식 대상 자체가 아니다(상류 실존 4fd6799fb 07-02·91f2d3c8c 07-10, fact 검색 25.4→3.8ms). 부산물로 GitHub search API 0건을 "부재"로 읽은 오판을 기록. 검색 0건은 인덱스의 침묵. 층위② 구조: hugh-kim.space Grover 이식 원글은 메커니즘(√N)은 못 오지만 "표시와 행동의 분리", "반복은 단조 개선이 아니다" 같은 제약의 형태는 온다는 것을 4후보 각각 판정(착지 1·이미 그 구조 2·저자 스스로 기각 1)으로 보였다. 착지분(모순 표면화)이 포크에서 fact↔principle 교차로 자란 과정을 소스 실측으로 추적. 표시 전용 경계를 반환 타입으로 강제(점수·순위 필드 부재), 임계 0.8은 첫 트랜치 점수 분포에서 잘라낸 값, 판정 순서 효과 0.182 실측 후 Fisher-Yates 표별 셔플+중앙값 confidence, 스캔 커버리지 5상태로 "모순 0"과 "검증된 무모순" 분리, 재판정 큐의 시스템 회수(resolution NULL)와 사람 해소 구분(v1.8.0→1.10.1, 오탐률 71%→~25%). 층위③ 방법: arXiv 2607.21551(Ananth·Sahai, 1비트 일회용 대칭키 복제불가 암호를 계산 가정 없이 구성)에서 이식된 것은 no-cloning이 아니라 "6년 고착의 용의자는 마지막 시도가 아니라 모든 시도의 교집합"이라는 절차. keystone 규칙 + 전략탐색기 14번째 카테고리로 배선(연속 실패 2회 트리거, 누적이 아닌 이유가 반례와 함께 주석에 명시, banned: 마커 없으면 exit 2), 검증기 강도가 위임 깊이를 결정한다는 조건 병기. 07절은 대칭이다. 원글이 rerank를 단조 변환이라 기각한 것과 나란히, 우리 코퍼스-novelty 가설도 G2에서 기각(user-specific 0.0635 ≈ knowledge 0.0638)된 기록을 놓아 착지율이 우열이 아니라 공통 규율임을 보인다. 08절은 계보다. 이 포크가 상류(원작자 memory-bank)의 어디에 서 있는지 밝힌다. 원작자 분석 글이 선언한 4원칙(Archive First·Recall Split·Evolution Aware·Grounded Surface)에는 성능이 없는데 상류 커밋이 쌓인 축은 성능·규모(주입 데몬 2.3s→0.2s, int8 25.4→3.8ms, 포맷 199~1600ms→26ms, consolidation 18라운드, 31만 대화·2.4만 fact)이고, 포크가 쌓은 축은 정합성·판정(원칙 교차·F1~F5·E1~E2v2·커버리지 5상태, 1.7만 fact)이다. 규모가 다르면 병목이 다르다는 위치 차이이며, 상류가 성능을 먼저 밀어준 덕에 포크가 정합성에 시간을 쓸 수 있었다(int8·주입 v2 모두 상류 유래). 핵심은 포크의 정합성 작업이 새 방향이 아니라 상류가 선언한 Evolution Aware의 구현이라는 점이다. 갈라선 게 아니라 같은 선언의 다른 구간. 동기화도 계약으로 고정(merge-only·버전 단조증가·채택/보류/기각 triage 기록, 3D 지식 은하는 별도 시각화 스택 사유로 보류). 재사용 산출물은 3단 심사(용어 제거 → 고전 정식 홈 → 측정 게이트). 물리 메커니즘 채택 0건.
하네스 3자 비교
사용자 제보 두 repo(Q00/ouroboros 5.1K⭐ Agent OS · Yeachan-Heo/gajae-code 2.2K⭐ 독립 에이전트)를 셸로우 클론 소스 실측으로 해부하고 keystone-hub 현행 canon(rules 58)과 14축 매트릭스로 3자 동시 비교한 reference intake 시각화판. 철학 대비(규칙+사람 게이트 vs 불변 Seed 스펙 vs 합의 계획+증거) → 매트릭스 3장(게이트·증거 / 상태·컨텍스트 / 실행·격리: covered 7 · partial 4 · gap 1 · 설계차 2) → 계보(두 소스 모두 과거 추출 규칙이 2026-05-02 감사에서 "미구현 이론"으로 삭제된 전력, 이번 기준: 코드가 되는 것만 채택) → 판정(제품 도입 0: ouroboros reference-only · gajae watch / pilot 3: vague-AC 린트·CLI argv-replay 증거·L1 vagueness pre-gate · 전부 기존 스크립트 확장, 규칙 신설 0건). 부수 발견: 런타임 125 vs 소스 58 규칙 발산.
Keystone 커리큘럼
외부 하네스 공학 커리큘럼(Study Harness v8)의 14과목·2트랙 형식을 차용해 keystone-hub 자산(rules 58 = universal 35 + personal 23, hooks 46, skills 112)을 과목별로 매핑한 실증 커리큘럼. 과목마다 교리 한 줄 + 대표 자산 칩 + 사고/수확/운영 실증 1건: 17차 리뷰 중간질문 마찰(HE201), gh auth switch 병렬 오염(HE202), session-context 720 facts 오염(HE203), Supabase MCP 계정 divergence(HE301), worktree 교차 오염 2회(HE303), QA 5연속 차단(HE304), pre-push fork bomb 54분(HE305), 죽은 훅 30일 무증상(HE401). 이수 체계도는 원본 결함 수정판(범례 도입 + HE203⇢HE305·HE302⇢HE401 권장 간선). 핵심 관찰: 과목의 두께 = 사고 이력의 두께. 수명 분류표(휘발/영속/결정론/격리)의 keystone 실측판 포함.
Trend Harvester 해부
keystone-hub trend-harvester의 수집 대상·플로우·게이트를 코드와 40일 실측으로 해부. 지정 수집 호스트(MacBook Pro) 1대에서 launchd 6시간 주기로 결정론 스캔(런당 251건: 구루 GitHub 8인 120 · 토픽 30 · 롱테일 watch 50 · ThreadReader 7 · 포럼 44, 20~31초, LLM 0회) 후, 트리아지가 참여신호 점수(목격 ≥2일 + Δ★100/교차소스)→LLM 의견(도입|이식|참고만|기각)→3갈래 라우팅(이슈/repo 기록/유예)으로 사람 앞에 걸러 놓는다. 원작자 공개 글의 자가적용 루프 설계에서 채택 고리를 끊고(2026-07-03) 의견 선행 이슈 큐로 협착(07-14, PR #181)한 재설계. 자동 채택 0건이 의도된 성공 상태. 백로그 6건 게이트·trusted_bin·README 데이터 펜스·강신호 기각 강제 파일 등 무인 자동화의 fail-closed 설계 포함.
memory-bank 포크 해부
원작자(jung-wan-kim)의 memory-bank와 사설 포크의 관계를 해부. 8일간 4회 동기화로 업스트림 101커밋을 채택하고, 포크 전용 66커밋(Codex 세션 색인·프라이버시 방어·런타임 핀·온톨로지 경화)을 유지하는 구조. 코드 층은 얇게, 운영 계약 4개(merge-only·버전 단조 증가·마켓플레이스 소스 고정·triage 기록)와 실측 함정 카탈로그 8건이 본질.
AKM 4편
최신순 정렬 · 카드를 누르면 원본 리포트로 이동합니다.
AKM 성적표 2026-08
2026-08 회차 AKM 스코어카드 (akm.cmdspace.work report.html 포맷, 로컬 임베드·무전송). 총점 87.5/M4, 25기준 히트맵 + 필러 점수 + 환경 지표 + 그 회차까지의 성장 궤적.
AKM Index 셀프 평가 2026-08
AKM Index v1.0 2회차 재평가의 공개 편집본. 총점 87.5/M4(+3.0)를 필러별 적대 서브에이전트 5기가 spot-check 24건으로 확정(조정 1건: C5 4→3). 25기준 중 11개가 이동했다. 상승 7(권한 deny 플로어 배포, 컨텍스트 예산 실측, 주간 리뷰 4주 실물, 공개 게이트·컨설팅 적용 등)은 절반 이상이 7월 로드맵 실행의 직접 결과이고, 하강 4(C3·C5·H4·X2)는 자동 배선과 측정 기록을 요구한 기준 강화다. 남은 병목은 탐지기는 있는데 스케줄에 연결되지 않은 세 곳(C5·C3·C2). 점수·판정·궤적은 내부판과 동일하고 보안 감점의 세부 표현만 일반화했다.
AKM 성숙도 추적
AKM Index v1.0으로 지식관리 시스템 성숙도를 회차별 누적 측정한 종단 추적. 최신 2026-08: 87.5/M4. 점수 궤적 + 필러 트렌드 + 최신 개선 제안 + 회차별 스코어카드/분석 링크. 회차가 쌓일수록 자라는 요약·제안 surface.
AKM 성적표 2026-07
2026-07 회차 AKM 스코어카드 (akm.cmdspace.work report.html 포맷, 로컬 임베드·무전송). 총점 84.5/M4, 25기준 히트맵 + 필러 점수 + 환경 지표 + 그 회차까지의 성장 궤적.