새 모델을 도입했다고 계획자, 평가자, 장문 지침, 컨텍스트 초기화를 한꺼번에 없애면 결과가 나빠져도 원인을 찾기 어렵습니다. 반대로 모두 유지하면 예전 모델의 한계를 보완하던 장치가 계속 필요한지 알 수 없습니다. 해결책은 부품 하나만 바꾸는 제거 실험 티켓입니다. 이 글을 읽고 나면 비운영 환경에서 티켓 한 장을 실행하고 유지·조건부 사용·제거·롤백 중 하나를 판정할 수 있습니다.
변경 티켓의 머리말
먼저 대상 과제, 저장소 커밋, 모델 식별자, 프롬프트, 사용 가능한 도구, 성공 조건을 적습니다. 가격이나 공개 벤치마크 수치를 기준으로 삼지 마세요. 팀의 실제 과제에서 결과를 검증하는 것이 목적입니다. Anthropic의 에이전트 평가 안내는 에이전트가 말한 최종 답변과 환경의 최종 상태를 구분합니다. “완료했다”는 문장보다 테스트 통과, 생성 파일, 변경된 레코드처럼 확인 가능한 결과를 성공 조건으로 둡니다.
변경란에는 부품 하나만 씁니다
평가자 제거, 계획 단계 제거, 장문 규칙 축약처럼 한 항목만 선택합니다. 다른 설정은 기준 실행과 같게 둡니다. Anthropic의 장기 실행 하네스 설계 글은 각 구성요소가 모델의 빈 능력을 대신한다고 설명합니다. 모델이 바뀌면 구성요소를 하나씩 제거해 스트레스 테스트하라는 제안도 담고 있습니다. 어떤 구성요소가 항상 필요하다는 결론도, 최신 모델이면 모두 불필요하다는 결론도 공식 근거로 삼지 않습니다.
판정란은 세 종류의 증거로 채웁니다
첫째, 결과 증거에는 핵심 요구 충족 여부와 회귀 테스트를 적습니다. 둘째, 과정 증거에는 잘못된 도구 호출, 되돌림, 사람 개입, 멈춤 조건 발동을 적습니다. 셋째, 운영 증거에는 실행 시간과 사용량을 같은 측정법으로 기록합니다. 횟수나 합격선은 팀이 사전에 정하되, 결과를 본 뒤 유리하게 바꾸지 않습니다.
Anthropic의 Managed Agents 설계 글은 하네스가 품고 있는 가정이 모델 개선과 함께 낡을 수 있다고 설명합니다. 이 글에서는 그 제품의 내부 성능 수치나 아키텍처를 일반 규칙으로 옮기지 않습니다. 실험 티켓에는 현재 구성요소와 지식 원천을 고정하고, 모델 또는 과제가 바뀔 때 과거 판정을 자동 승계하지 않는 재검토 조건만 반영합니다.
판정은 네 문장 중 하나로 끝냅니다
- 유지: 제거 후 핵심 결과나 회귀 조건이 깨졌습니다.
- 조건부 사용: 어려운 과제나 특정 경로에서만 손실이 재현됐습니다.
- 제거: 결과 조건을 유지했고 추가 장치의 효용을 확인하지 못했습니다.
- 롤백: 도구 오작동, 데이터 변경, 평가 환경 이상으로 비교 자체가 무효입니다.
복잡성은 측정 가능한 개선이 있을 때만 더하라는 Anthropic의 설계 원칙도 같은 방향입니다. 다만 실험이 운영 권한이나 실제 고객 데이터를 건드리면 즉시 중단하고 샌드박스로 옮기세요. 평가자가 없어도 안전하다는 결론은 별도의 권한·보안 검증을 대체하지 않습니다.
마지막으로 티켓에 기준 실행과 제거 실행의 증거 링크, 판정자, 다음 재검토 조건을 적으세요. 모델 또는 과제가 바뀌면 과거 판정을 자동 승계하지 않습니다. 하네스는 영구 설비가 아니라 현재 과제에 대한 가설이며, 한 번에 하나씩 검증해야 관리 가능한 설계가 됩니다.
확인한 공식 출처
- Anthropic, Harness design for long-running agents — 확인일 2026-08-31
- Anthropic, Demystifying evals for AI agents — 확인일 2026-08-31
- Anthropic, Managed Agents — 확인일 2026-08-31

