01방법론 · 3점 측정
같은 일곱 프로젝트를 두 시점, 세 관점에서 잰다. 2026년 4월의 판정을 요약하고, 2026년 8월의 상대를 다시 조사하고, 그 위에서 keystone-hub를 다시 심판대에 올린다.
이 리포트는 1편에서 다룬 "비교→개선 루프"의 세 번째 바퀴다. 2026년 4월, ai-rules는 자기 위치를 알기 위해 오픈소스 7종과 자신을 비교했고, 그 격차를 P1~P19 로드맵으로 바꿔 실행한 뒤 재평가까지 마쳤다. 그리고 5월 말 ai-rules는 keystone-hub로 흡수되며 아카이브됐다(마지막 손질 커밋은 07-03). 그렇다면 지금, 같은 상대들 앞에서 후계 시스템은 어디에 서 있는가. 이 질문에 답하려면 세 개의 측정점이 필요하다.
| 측정점 | 무엇을 재나 | 데이터 출처 |
|---|---|---|
| 2026-04 판정 | 당시 ai-rules가 각 상대와 자신을 비교해 내린 결론. Superpowers·ECC·Claude Code 공식 3종은 Before/After 재평가 페어가 존재. | ai-rules docs/research/ 7개 문서 원문 |
| 2026-08 재조사 | 상대 프로젝트의 현재 상태. 버전·star·활동성·정체성 변화. 전 항목 조회일 2026-08-08 고정. | GitHub API · 저장소 페이지 · npm registry · 로컬 설치본 |
| keystone 재판정 | 당시 판정이 지금도 유효한가. keystone-hub의 현재 실측(rules 63 · active hooks 50 · skills 120 · doctor 체크 34)을 기준으로 다시 심판. | keystone-hub 로컬 체크아웃 실측 (2026-08-08) |
02Superpowers 04: 대등 경쟁 08: 경쟁자에서 부품으로
4월에는 넘어야 할 벽이었다. 8월의 관계는 더 흥미롭다. keystone-hub는 Superpowers를 플러그인으로 설치해 쓰는 소비자가 됐다.
Before: Superpowers A- vs ai-rules B. "규칙 선언만 있고 행동 교정이 없다", 테스트 가능성 D, CLAUDE.md 2,500줄 컨텍스트 부담.
- After: 변명 방지 테이블·스킬 8종·테스트 19시나리오로 A, "대등한 경쟁" 선언
- 잔여 열세 3건: 스킬 세분화(15 vs 8) · .jsonl 트랜스크립트 분석 · marketplace 배포(6개 플랫폼)
v6.2.0 (07-24) · star 268,801. 스킬은 13~14개로 고정한 채 지원 하네스를 10종으로 확장, v6.0.0에서 벤더 중립 어휘로 전환했다.
- v6.1~6.2: 부트스트랩 압축·스킬 문서 다이어트, 토큰 비용 최적화 캠페인
- 멀티 하네스 성장통이 릴리스 노트에 그대로: 크로스 하네스 훅 오염 수정(v6.1.1) 등
- 이 머신의 플러그인 캐시는 5.1.0에 멈춰 있어 v6 라인 미적용
경쟁 구도 자체가 소멸했다. keystone은 Superpowers의 brainstorming·TDD·worktree 스킬을 플러그인으로 실사용 중이다. 벽이 부품이 됐다. [검증됨: 로컬 설치]
- 잔여 열세 재판정: 스킬 수는 120 vs 14로 수치 역전, 다만 성격이 다르다(운영 자산 vs 방법론) [추론]
- marketplace 배포는 격차가 아니라 노선 차이로 재분류. 비공개 개인 하네스에 배포 축은 비목표(P13 영구 보류의 실제 이유)
- 트랜스크립트 분석 열세는 여전히 부분 커버. s10의 백로그로
03Everything Claude Code 04: 실효성 기준 역전 08: Harness OS 선언
4월 판정의 핵심 문장은 "181개 스킬은 마크다운 텍스트 파일이며, 강제할 수단이 없다"였다. 8월의 ECC는 그 비판의 방향으로 조금씩 움직이고 있다.
Before: ECC 94 vs ai-rules 87. Commands/Skills 축은 C(45점), 평가 문서 표현으로 "없음". 규모·커뮤니티에서 완패.
- After: Commands/Skills C(45)→A(90), 총점 95로 "실효성 기준 역전" 선언
- 논지: "얼마나 많이 만들었냐보다 얼마나 강제할 수 있냐가 실질 품질 기준"
- 잔여 열세: 규모(스킬 181) · 커뮤니티(170+ 기여자) · npm 배포 · 다국어 문서
v2.1.0 (07-27) · star 238,596 · 저장소 개명. v2.0.0에서 "The Agent Harness Operating System"으로 리브랜딩, Claude 전용을 벗어나 Codex·Cursor·Zed까지 확장.
- 스킬 284개로 확장 노선 유지 (문서 내 집계도 281/282/284로 3중 불일치)
- 반대 신호 첫 등장: MCP 기본 커넥터를 1개로 축소, 나머지 옵트인 전환
- Plan Canvas(플랜 시각 승인 UI), 스폰서 3사·유료 티어로 상업화 가속, 공급망 보안 하드닝
"만들기 vs 강제하기" 구도는 유지, 다만 상대가 수렴 중. 표면 축소(MCP 옵트인)와 보안 하드닝은 4월에 ai-rules가 서 있던 방향이다. [추론]
- keystone의 현재 답: rules 63 + active hooks 50 + doctor 34체크. 강제 우선 노선 지속 [검증됨: 실측]
- 규모 축은 여전히 ECC 우위(284 vs 120). 다만 keystone 120은 전량 자기 워크플로우 실사용 자산이라 비교 축이 다르다 [추론]
- 커뮤니티·npm 배포·상업화 축은 비목표 유지. 4월과 같은 결론, 이제는 선택이라는 확신이 더해졌다
04Claude Code 공식 04: 상호 보완 08: 공식의 흡수, 경계선 이동
4개월 동안 정확히 100개 버전이 배포됐다. 4월에 서드파티 거버넌스 계층의 차별점이던 것들 상당수가 그 사이 공식 표면으로 들어왔다.
"경쟁이 아닌 상호 보완." 다만 공식의 결정론이 부러웠다. "permissions.deny는 AI 의지와 무관하게 100% 차단한다."
- 지적된 열세: 훅 이벤트 2종 vs 8+종, SessionStart 부재, 호출 캡 부재
- After: P6~P9로 대부분 해소, "운영 거버넌스 완성도 대등" 선언
- 플랫폼 의존 영역(sandbox, managed settings)은 "도달할 수 없는 영역"으로 인정
v2.1.226 · star 140,614 · 4개월간 +100 릴리스. 골격(hooks·plugins·Skills·sandbox) 위에 정책·통제·규모화 레이어가 붙은 기간.
- Dynamic Workflows: 수십~수백 에이전트 오케스트레이션 공식화
- 서브에이전트 폭주 가드 내장(동시 실행 캡·중첩 깊이 제한)
- sandbox 자격증명 마스킹·네트워크 allowlist, managed settings 강제력 확대(버전·모델·마켓 allowlist)
- 플러그인 SHA-256 핀 설치 + 세션당 토큰 비용 추정, auto memory 공식화
보완 관계는 유지, 경계선이 위로 이동했다. "규칙을 배포하고 훅으로 강제한다"는 기능 자체는 더 이상 차별점이 아니다. [추론]
- 남은 존재 이유 3가지가 선명해졌다: cross-CLI 정본(공식 기능은 Claude 생태계 안에서만 유효) · 규칙 콘텐츠(무엇을 규칙으로 삼을지는 공식이 안 준다) · 버전 드리프트 흡수(4개월 100릴리스의 기본값 반전 추적)
- 셋 다 keystone이 실제로 하는 일이다: 프로파일 4종 × 2 CLI 배포, rules 63의 도메인 내용, 정기 릴리스 추적 창구 운영 [검증됨: 실측]
- 공식 스폰 캡은 세션 스코프라 크로스 프로세스 재귀는 못 막는다. 훅 계층의 재귀 가드가 여전히 필요한 이유 [검증됨: changelog 스코프]
05Get Shit Done 04: 34/45 동점 08: 원본 사망, 포크 재출발
일곱 상대 중 유일하게 저장소가 죽었다. 원본은 아카이브됐고, 커뮤니티 포크가 star 0에서 다시 시작했다. 1인 관리자 리스크의 교과서적 실증.
총점 34/45 동점, "경쟁이 아니라 상호 보완". GSD는 프로세스 오케스트레이션(Plan→Execute→Verify)의 최강자, 규칙 설계는 얕다는 판정.
- 배울 것으로 지목: Context Monitor · Prompt Guard(정규식 15종) · Thin Orchestrator
- 실제로 그날 P20(인젝션 방어)·P22(컨텍스트 모니터링)로 흡수됨
- 불채택: advisory 전용 훅, 12K줄 단일 파일, 커맨드 75개의 과도한 표면
원본: 06-26 아카이브 (star 64,739 동결). 관리자 연락 두절, 연관 토큰 러그풀 의혹까지(포크 측 3자 서술, 미확정).
- 커뮤니티 조직 Open GSD가 포크: open-gsd/gsd-core, star 7,886에서 재출발, v1.9.1(07-31)로 버전 리셋
- 루프는 5단계로 확장(Discuss→Plan→Execute→Verify→Ship), 멀티 런타임 지원
- 활동성: 활발(조회 당일 push). 핵심 접근은 살아남았고, 소유권만 바뀌었다
교훈이 두 겹이다. 하나는 채택 전략의 검증, 하나는 의존 전략의 경고. [추론]
- 4월에 코드가 아니라 아이디어를 차용(P20·P22)한 덕에, 원본이 죽어도 keystone 안의 인젝션 방어·컨텍스트 모니터링은 무사하다. collect-only 원칙의 사후 검증
- 외부 플러그인 의존에는 같은 리스크가 그대로 적용된다. 커밋 핀 + 출처 기록(PROVENANCE) 정책이 그 방어선 [검증됨: 운영 중]
- keystone도 1인 시스템이지만 구조가 다르다: 사용자=관리자=수혜자라 "관리자 이탈" 시나리오 자체가 성립하지 않는다. 대신 백업·다머신 동기화가 대응 축
06Hermes Agent 04: 계층 관계 08: 자가개선으로 227K
4월 문서의 결론은 "카테고리 자체가 다르다"였다. 그 판정은 유효하다. 흥미로운 건 다른 축이다. 당시 단호하게 불채택했던 "스킬 자기 생성"을 keystone은 그 사이 조건부로 수용했다.
"경쟁이 아니라 계층 관계." Hermes는 에이전트 런타임 그 자체, ai-rules는 그 위의 정책 계층. 3자 비교에서 GSD·Hermes·ai-rules 모두 34/45 동점.
- 배울 것: 실행 시점 안전(위험 명령 35패턴 · 인젝션 10패턴 · 시크릿 레닥션 30+) → P21·P23으로 흡수
- 불채택 판정: "스킬 자기 생성/패치는 거버넌스 철학과 충돌"
star 227,121 · v0.20.0 (08-03) · 매우 활발. 공개 반 년 만에 227K, 자가개선이 정체성의 중심이 됐다. "The agent that grows with you."
- 경험에서 스킬 자동 생성, 사용 중 스킬 자기개선, 세션 검색, 사용자 모델링
- 자가개선 연구는 별도 저장소로 분리(ICLR 2026 Oral), Desktop 앱 공개 프리뷰
- open issue 29.5K: 초대형 바이럴 저장소 특유의 부하 신호
계층 관계 판정은 유지. 재밌는 건 자가개선 축의 재판정이다. 4월의 단호한 거부가 8월에는 조건부 수용이 됐다. [검증됨: keystone 규칙 실측]
- keystone은 self-improve(마찰 패턴→개선안)와 야간 스킬 최적화 루프를 운영하되, holdout 게이트 + 사람의 adopt 승인을 사이에 끼웠다. "에이전트가 자기 규칙을 못 고친다"에서 "고치되 채점표를 속일 수 없고 채택은 사람이 한다"로
- Hermes가 자가개선을 전면에 걸고 227K를 얻는 동안, 같은 축을 게이트 뒤에 두는 쪽을 선택한 것. 속도 대 통제의 트레이드오프를 의식적으로 진 셈이다 [추론]
- 실행 시점 안전(P21·P23 유래 자산)은 훅 50종 체계 안에 현역으로 남아 있다
07Codex CLI 04: 훅 갓 안정화 08: 공식 표면 수렴
4월의 Codex는 훅이 막 안정화되고 플러그인이 태동하던 상태였다. 8월의 Codex는 Claude Code 설정을 통째로 가져오는 /import까지 갖췄다. 두 공식 CLI의 거버넌스 표면이 수렴하고 있다.
제품 코드베이스 안에 스킬을 내장한 구조의 관찰. ai-rules는 규칙을 생성하는 메타 레이어라는 위치 확인.
- Codex 우위로 기록: 자율 PR 루프(babysit-pr) · 800 LoC 모듈 크기 CI 게이트 · 컨텍스트 하드 캡
- ai-rules 우위로 기록: R0/R1/R2(Codex "없음") · HANDOFF · self-improve
- 채택 제안 3건 + 역방향 제안 3건(가역성 분류, 우선순위 번호, HANDOFF)
0.147.0 (08-07) · star 104,671. permission profiles가 권한 모델의 정본으로 확립되고, 플러그인 생태계가 급성장했다.
- 훅 확장: TUI 브라우저, 컴팩션 전후 훅, PreToolUse 컨텍스트 주입, 서브에이전트 identity
- /import: Cursor·Claude Code의 설정·MCP·플러그인·세션·메모리 마이그레이션 + Claude Code 마켓플레이스 호환
- 엔터프라이즈 거버넌스: managed config 번들, 자동 리뷰(Guardian), managed auth
"두 CLI에 같은 규칙을 뿌린다"는 존재 이유를 공식이 직접 겨냥하기 시작했다. 그런데 겨냥이 오히려 남은 역할을 선명하게 만든다. [추론]
- /import는 단방향 1회성 마이그레이션이고, 정책 포맷은 여전히 비호환(managed-settings.json vs requirements.toml). 지속 동기화·doctor 검증·회귀 감시는 여전히 외부 계층 몫
- keystone은 그 역할의 현역 실증이다: apply.sh가 Claude용 자산을 Codex 스킬로 변환 배포, 두 CLI를 한 정본에서 운영 [검증됨: 실측]
- 4월 역방향 제안(가역성 분류 등)은 공식에 채택되지 않았다. 규칙 "내용"의 공백은 여전하다
08커뮤니티 훅 군 04: 5종 일괄 분석 08: 양극화
4월에 분석한 다섯 프로젝트의 넉 달 뒤 운명이 극단적으로 갈렸다. 개별 훅 키트는 멈췄고, 설치형 패키지만 살아남아 성장했다.
| 프로젝트 | 04월의 기록 | 08월 상태 | 판정 |
|---|---|---|---|
| karanb192/claude-code-hooks훅 구현 키트 · "즉시 ROI 최고 채택" 지목, P20·P23 원천 | 훅 4개 · 정규식 125패턴 · 테스트 262개 | star 466 · push 08-04 | 활발 훅 9개·테스트 1,238개, 설치형 마켓플레이스로 전환 |
| johnlindquist/claude-hooksTS 타입 안전 훅 프레임워크 | 훅 템플릿 8종 · 커버리지 80%+ | star 389 · push 2025-08-08 | 중단 조회일 기준 정확히 1년 무커밋 |
| disler/claude-code-hooks-mastery전체 이벤트 훅 마스터 가이드 | 훅 13개 · README 930줄 | star 3,879 · push 03-04 | 정체 완결형 교육 자료로 참조 가치는 유지 |
| garrytan/gstack창업자 페르소나 거버넌스 패키지 | 스킬 34개 · 당시 "비공개(상용)" 분류 | star 126,822 · push 08-07 | 폭발 성장 MIT 명시, "23 specialists + 8 power tools" 페르소나 재포장 |
| hesreallyhim/awesome-claude-code큐레이션 목록 (당시 202개 리소스) | 리소스 202개 · 9 카테고리 | star 51,867 · push 08-08 | 활발 데이터 파일 기반 자동 생성으로 구조화, 생태계 지도 지위 강화 |
"멀티 도구 동기화, 프로젝트 프로파일, R0/R1/R2 가역성, 규칙 충돌 해결에는 확인 범위 내 대응 기능 미발견." karanb192 패턴 채택이 최고 ROI로 지목됐고, 실제로 P20·P23·P24의 원천이 됐다.
"대응물 미발견" 판정은 이번 재조사 범위에서도 유지된다. 멀티 CLI 동기화 + 가역성 등급 + 충돌 매트릭스의 조합을 갖춘 커뮤니티 프로젝트는 다섯 중 없다(전수 조사가 아니므로 범위 한정). [추론]
더 큰 신호는 배포 형태의 자연선택이다. 공식 마켓플레이스 시대에 개별 훅 키트는 도태되고 설치형 플러그인·페르소나 패키지만 살아남았다. keystone이 플러그인 소비자 겸 자체 정본 운영자라는 이중 위치를 갖게 된 배경이기도 하다. [추론]
09종합 파노라마
일곱 상대의 두 시점 판정을 한 표에 놓는다. 열두 줄 요약: 상대는 전부 커지거나 죽었고, 판정의 축은 "누가 더 잘하나"에서 "누가 무엇을 맡나"로 이동했다.
| 대상 | 2026-04 판정 | 상대의 변화 (04→08) | keystone 재판정 (08) |
|---|---|---|---|
| Superpowers | B→A, "대등한 경쟁" | v5.0.7→v6.2.0 · 268.8K★ · 하네스 10종 벤더 중립 | 경쟁 소멸, 플러그인으로 소비. 방향의 교차 검증자 |
| ECC | 87→95, "실효성 역전" | 개명+Harness OS 선언 · 238.6K★ · 스킬 284 | 강제 우선 노선 유지. 상대가 표면 축소로 수렴 중 |
| Claude Code 공식 | "상호 보완", 운영 대등 | +100릴리스 · workflows·스폰 캡·sandbox 정밀화 | 배포·강제는 차별점 소멸. cross-CLI 정본·콘텐츠·드리프트 흡수가 남은 몫 |
| GSD | 34/45 동점, 보완 | 원본 아카이브 · 커뮤니티 포크 재출발(7.9K★) | 아이디어 차용 전략의 사후 검증. 의존 핀 정책의 경고 사례 |
| Hermes | "계층 관계" | 227.1K★ · 자가개선이 정체성 중심으로 | 계층 판정 유지. 자가개선은 거부에서 게이트 뒤 수용으로 진화 |
| Codex CLI | 구조 관찰 + 상호 제안 | 0.147 · /import·플러그인·profiles로 CC와 수렴 | 멀티 CLI 정본 계층의 가치가 오히려 선명해짐. 현역 실증 중 |
| 커뮤니티 훅 군 | "가역성·동기화 대응물 없음" | 양극화: 2 성장 · 1 전환 · 2 정지 (gstack 126.8K★) | 미발견 판정 유지(범위 한정). 배포 형태는 설치형 패키지로 수렴 |
10남은 격차 · 다음 루프
1편의 명제가 맞다면, 재평가는 결론이 아니라 다음 로드맵의 입력이어야 한다. 이번 재조사에서 드러난 격차를 후보 순서로 적는다. 전부 [추론]이고, 채택은 사람의 몫이다.
후보 1 · Superpowers 플러그인 세대 갱신
로컬 캐시 5.1.0 vs 상류 v6.2.0, 3개월 격차. v6 라인의 SDD 재작성·부트스트랩 압축은 keystone의 토큰 규율과 같은 방향이라 이득이 명확하다. 다만 v6.1.1이 고친 "크로스 하네스 훅 오염" 같은 성장통이 있으니, 커밋 핀 갱신 + 검증 절차를 거칠 것. 근거 강도: 실측 격차 [검증됨].
후보 2 · 공식 흡수분과의 중복 재범위화
스폰 캡·sandbox 자격증명·auto memory 등 4~8월에 공식으로 들어온 기능과 겹치는 자체 규칙·훅의 역할을 재정의할 때다. 선례가 이미 있다: 재귀 가드 규칙은 공식 세션 캡이 나왔을 때 "대체가 아니라 보완"으로 경계를 명시했다. 같은 작업이 sandbox·메모리 축에도 필요하다. 근거 강도: 공식 changelog 실측 + 선례 1건.
후보 3 · 트랜스크립트 분석 축
4월 Superpowers전에서 열세로 기록된 세 항목 중 유일하게 완전 해소되지 않은 축. 세션 기록에서 토큰 비용·행동 패턴을 끌어내는 층은 지금도 부분 커버(메모리 색인, usage 신호)에 머문다. 공식 auto memory·플러그인 비용 추정이 반쯤 흡수했으니, 남은 몫이 정확히 무엇인지 측정부터. 근거 강도: 4월 문서 + 이번 재조사 대조.
후보 4 · /import 시대의 어댑터 재평가
Codex가 Claude Code 설정 마이그레이션과 마켓플레이스 호환을 공식화했다. keystone의 adapter export가 커버하던 표면 중 무엇이 공식 경로로 대체 가능한지, 무엇이 남는지(지속 동기화, 검증, 회귀 감시) 목록화할 시점. 근거 강도: Codex 릴리스 원문.
후보 5 · 재평가의 상시화
이번 7종 재조사는 수동 이벤트였다. 1편의 결론("일회성 비교가 상시 루프로")을 이 축에도 적용하면, 주요 상대의 버전·활동성 변화를 주기 수확 궤도에 태워 다음 재평가의 비용을 낮출 수 있다. 근거 강도: 이번 작업 자체의 비용 실측.
11출처 · 경계
출처
- 2026-04 판정 · ai-rules 아카이브 저장소의 docs/research/ 비교 문서 7종 + archive Before판 원문. 인용은 원문 그대로.
- 2026-08 재조사 · GitHub REST API + 저장소 페이지 + GitHub Releases + npm registry + 로컬 플러그인 설치본. 전 수치 2026-08-08 조회 고정. API와 페이지 렌더 양쪽 일치 확인 값만 본문 게재.
- keystone 실측 · keystone-hub main 체크아웃 파일 카운트·게이트 인벤토리·apply.sh 헤더 (2026-08-08).
- 1편 · 비교→개선 루프의 기록 (철학 원점과 4월 타임라인의 상세).
경계
- 공개판이다. 로컬 경로·개인 식별자는 스크럽했고, 수치와 판정은 비공개 원판과 동일하다.
- 스냅샷 문서다. 일곱 상대 중 다섯이 조회 당일에도 push되는 활성 프로젝트라, 수치는 2026-08-08 기준으로 동결했다. star는 시각에 따라 흔들린다.
- 두 시점의 측정 방법이 다르다. 4월 수치는 당시 문서에 기록된 값(자체 평가 포함), 8월 수치는 API 실측. 점수 비교가 아니라 방향 비교로 읽을 것.
- keystone 재판정은 외부 심판이 아니라 당사자 판정이다. 사실 근거는 [검증됨], 해석은 [추론]으로 본문에 구분했고, 4월 문서들이 그랬듯 이 판정도 다음 재평가에서 뒤집힐 수 있다.
- GSD 포크 경위 중 관리자 관련 서술은 포크 측 3자 주장으로, 확정 사실이 아니다.