Grok 4.5를 비교할 때 입력 2달러·출력 6달러만 적으면 예산이 틀어질 수 있다. 2026년 8월 31일 확인한 xAI 공식 가격표는 프롬프트가 20만 토큰에 도달하면 요청 전체에 장문 요율을 적용한다. 캐시, 출력, 서버 도구, 재시도를 나눠 기록해야 실제 업무 비용을 비교할 수 있다.
먼저 빈 비용 장부를 만든다
| 기록 열 | 무엇을 적나 | 빠지면 생기는 오류 |
|---|---|---|
| 커밋·과제 | 같은 코드와 완료 조건 | 난도가 다른 작업을 비교함 |
| 입력·캐시·출력 토큰 | 응답의 usage 값 | 장문 구간과 캐시 효과를 놓침 |
| 도구 호출 | 종류와 성공 횟수 | 토큰 외 비용을 누락함 |
| 재시도 | 실패 응답까지 포함 | 성공한 마지막 호출만 셈 |
| 완료 증거 | 테스트, 사람 수정 시간 | 값싼 미완료를 승자로 고름 |
Grok 4.5의 API 요율은 다음과 같다. 단위는 모두 100만 토큰당 미국 달러이며, 가격은 변경될 수 있으므로 계산 시 확인일을 함께 저장한다.
| 프롬프트 구간 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| 20만 미만 | $2.00 | $0.30 | $6.00 |
| 20만 이상 | $4.00 | $0.60 | $12.00 |
같은 식으로 두 요청을 재현한다
가정은 캐시 0, 도구 호출 0, 재시도 0이다. 입력 18만·출력 1만 토큰이면 180,000×2/1,000,000 + 10,000×6/1,000,000 = $0.42다. 입력이 21만·출력 1만이면 초과분에만 할증하는 것이 아니라 장문 요율로 210,000×4/1,000,000 + 10,000×12/1,000,000 = $0.96이다. 같은 3만 입력 증가가 청구액을 크게 바꾸는 이유다.
공식 가격표에는 성공한 1,000회 기준 웹 검색·X 검색·코드 실행이 각각 5달러, 첨부 검색은 10달러, 컬렉션·파일 검색은 2.50달러로 표시돼 있다. 도구를 쓴 예시는 호출 횟수와 성공 기준까지 적어야 다시 계산할 수 있다. API 비용과 Grok Build 구독·프로모션 한도는 청구 경로가 다르므로 한 열에 섞지 않는다.
예상치보다 실제 비용 필드를 우선한다
비용 추적 문서에 따르면 각 API 응답의 usage.cost_in_usd_ticks는 캐시 할인과 서버 도구비를 반영한 해당 요청의 실제 청구액이다. 1달러는 100억 ticks이므로 아래 식으로 환산한다.
요청 비용(USD) = cost_in_usd_ticks ÷ 10,000,000,000
이 값은 대화 누계가 아니다. 여러 턴과 재시도는 응답별 값을 합산한다. 스트리밍 REST·OpenAI SDK는 사용량 포함 옵션을 켜고 마지막 청크를 읽어야 하며, 공식 문서상 Vercel AI SDK는 현재 이 비용 필드를 노출하지 않는다. 이 경우 원시 REST나 지원 SDK로 검증 경로를 따로 둔다.
벤치마크는 공급자 측 증거로 표시한다
xAI의 Grok 4.5 발표는 자사 측 측정으로 SWE Marathon pass@1 29.0%, Terminal Bench 2.1 83.3%, SWE Bench Pro 해결률 64.7%를 제시한다. 경쟁 모델 수치는 각 개발사의 시스템 카드나 리더보드에서 가져왔고 평가별 하네스도 다르다고 명시한다. 따라서 이 숫자를 “코딩 전체 1위”나 내 저장소의 성공률로 바꾸면 안 된다.
독자는 공개 점수와 내부 시험을 분리한다. 같은 커밋에서 대표 과제 5개를 고르고 동일한 권한·완료 조건으로 실행한 뒤 테스트 통과율, 총 ticks, 재시도, 사람 수정 시간을 기록한다. 장문 요율 진입이나 도구비 때문에 완료 비용이 커지면 더 짧은 컨텍스트 전략도 함께 시험한다. 선택 기준은 가장 낮은 표면 단가가 아니라 같은 완료 증거를 만든 총비용이다.

