Skip to content

fix(autoresearch): capture benchmark exit code via PIPESTATUS - #756

Merged
baleen37 merged 1 commit into
mainfrom
feat/improve-auto-ressearch
Aug 8, 2026
Merged

fix(autoresearch): capture benchmark exit code via PIPESTATUS#756
baleen37 merged 1 commit into
mainfrom
feat/improve-auto-ressearch

Conversation

@baleen37

@baleen37 baleen37 commented Aug 8, 2026

Copy link
Copy Markdown
Owner

Summary

autoresearch 스킬의 crash 감지 버그를 수정하고, 자율 루프의 판정 신뢰도를 높이는 최소 변경 2개를 추가합니다.

Changes

1. EXIT_CODE 캡처 버그 수정 (핵심)

- EXIT_CODE=$?
+ EXIT_CODE=${PIPESTATUS[0]}

파이프라인 뒤의 $?tee의 종료 상태를 담습니다. tee는 거의 항상 성공하므로 벤치마크가 죽어도 EXIT_CODE=0이 되어, 모든 crash가 정상 결과로 JSONL 원장에 기록됩니다. 자율 루프에서 조용히 데이터가 오염되는 종류의 버그입니다.

2. Goodhart 가드레일keep 판정 전, metric이 개선된 게 작업이 빨라져서인지 작업이 안 일어나게 돼서인지 확인하도록 요구. 설명되지 않는 큰 개선은 보통 벤치마크가 약해진 것(캐싱, 반복 스킵, 입력 축소, 체크 완화)입니다.

3. ideas.md 체크박스 상태- [ ] 미시도 / - [x] 시도함. resume한 에이전트가 이미 시도한 아이디어를 재시도하는 것을 방지합니다. 기존에는 worklog.md와 교차 확인해야 알 수 있던 정보입니다.

4. 리서치 노트 추가docs/superpowers/research/2026-08-08-autoresearch-alternatives.md. "현재 설계보다 더 단순한 범용 대안이 있는가"를 1차 자료로 조사한 결과. 결론은 없음 — 현재 설계가 Anthropic의 long-running agent 가이드(progress file + git history)와 이미 일치합니다. 이 레포에 리서치 노트 관례가 없어 docs/superpowers/plans/의 date-prefix 규칙을 따라 형제 디렉토리 research/를 신설했습니다(파일 상단에 명시).

Tests

  • bats tests/70 passed, 0 failed
  • markdownlint — 위반 23개 → 22개 (신규 위반 0, 긴 줄 정리로 1개 감소)
  • shellcheck plugins/autoresearch/hooks/autoresearch-context.sh — OK
  • exit code 버그는 bash에서 직접 재현 검증: exit 17로 죽는 스크립트가 기존 코드에선 0으로 잡히고, ${PIPESTATUS[0]}에선 17로 정확히 잡힘. 성공 케이스는 0 유지.
  • /code-review — 발견 사항 없음

Notes

리서치에서 확인된 나머지 개선안(셸 루프 실행 모드, dashboard 재생성 완화, /rewind 기각 기록)은 이 PR 범위에 넣지 않았습니다.

Summary by CodeRabbit

  • Documentation

    • Added research comparing alternative autoresearch approaches, tools, and workflows.
    • Documented findings, recommendations, limitations, and source references.
  • Bug Fixes

    • Improved benchmark failure detection for experiment runs.
    • Prevented unexplained metric gains caused by weakened benchmarks.
  • Workflow Improvements

    • Added checkbox-based tracking for optimization ideas.
    • Resuming experiments now considers only untried ideas.

EXIT_CODE was read from $? after a pipeline, which holds tee's status
(~always 0), so crashed benchmark runs were logged as valid results.

Also adds a Goodhart guardrail before keep decisions and checkbox state
markers to the ideas backlog, plus research notes on simpler alternatives.
@baleen37
baleen37 enabled auto-merge (squash) August 8, 2026 03:25
@coderabbitai

coderabbitai Bot commented Aug 8, 2026

Copy link
Copy Markdown

Review Change Stack

Caution

Review failed

The pull request is closed.

ℹ️ Recent review info
⚙️ Run configuration

Configuration used: defaults

Review profile: CHILL

Plan: Pro Plus

Run ID: 03e301f3-e595-4c91-9a14-149f768123e8

📥 Commits

Reviewing files that changed from the base of the PR and between 672c9b8 and e97723b.

📒 Files selected for processing (2)
  • docs/superpowers/research/2026-08-08-autoresearch-alternatives.md
  • plugins/autoresearch/skills/autoresearch/SKILL.md

📝 Walkthrough

Walkthrough

autoresearch 대안 조사 문서를 추가하고, benchmark 종료 상태와 metric 개선 검증 규칙을 강화했다. ideas backlog는 체크박스 상태로 시도 여부를 추적하도록 변경했다.

Changes

autoresearch 대안 조사

Layer / File(s) Summary
대안 조사와 적용 범위 정리
docs/superpowers/research/2026-08-08-autoresearch-alternatives.md
autoresearch 실행 루프, 상태 관리, metric 최적화 도구를 비교했다. 현재의 progress file·Git history·metric 기반 구조를 유지하고 일부 실행 규칙을 적용하는 방향을 정리했다. 출처와 검증 상태도 기록했다.

실험 실행 프로토콜

Layer / File(s) Summary
실험 실행 및 아이디어 추적 규칙
plugins/autoresearch/skills/autoresearch/SKILL.md
PIPESTATUS[0]으로 benchmark 실패를 감지한다. 설명되지 않은 metric 개선은 조사 후 폐기한다. ideas backlog는 - [ ]- [x]로 시도 상태를 관리한다.

Estimated code review effort: 2 (Simple) | ~10 minutes

Possibly related PRs

  • baleen37/bstack#660: autoresearch skill의 이전 위치와 실행 및 아이디어 추적 프로토콜 변경과 직접 연결된다.
  • baleen37/bstack#668: 현재 autoresearch skill 파일의 도입 및 후속 실행 규칙 변경과 직접 연결된다.
✨ Finishing Touches
🧪 Generate unit tests (beta)
  • Create PR with unit tests
  • Commit unit tests in branch feat/improve-auto-ressearch

Thanks for using CodeRabbit! It's free for OSS, and your support helps us grow. If you like it, consider giving us a shout-out.

❤️ Share

Comment @coderabbitai help to get the list of available commands.

@baleen37
baleen37 merged commit 8637cff into main Aug 8, 2026
3 of 4 checks passed
@baleen37
baleen37 deleted the feat/improve-auto-ressearch branch August 8, 2026 03:26
baleen-release-app Bot pushed a commit that referenced this pull request Aug 8, 2026
## [17.42.2](v17.42.1...v17.42.2) (2026-08-08)

### Bug Fixes

* **autoresearch:** capture benchmark exit code via PIPESTATUS ([#756](#756)) ([8637cff](8637cff))
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant