Agent, Copilot 대안, 자체 LLM 게이트웨이를 검토하는 팀에게 OpenRouter는 피할 수 없는 이름입니다. API Key 하나, model 파라미터만 바꾸면 Claude, GPT, Gemini 등 300개 이상의 모델로 전환할 수 있습니다. 그런데 청구는 어떻게 계산될까요? Anthropic / OpenAI / Google 직연결과 얼마나 차이 날까요? 본 글은 2026년 7월 공개 요금을 기준으로 과금 공식, 숨은 비용, 3대 벤더 플래그십 모델의 실제 1회 호출 비용을 정리합니다.
OpenRouter 과금 공식: 1분 이해
OpenRouter는 선불 충전, token 종량 과금이며 월정액 플랜이 없습니다. 각 API 호출의 inference 비용 핵심은 다음과 같습니다.
1회 inference 비용
비용 =(입력 token ÷ 1,000,000 × 입력 단가)+(출력 token ÷ 1,000,000 × 출력 단가)
단가는 미국 달러 「100만 token당」으로 표시되며, OpenRouter 모델 목록과 각 모델 상세 페이지에서 확인할 수 있습니다. 입력과 출력은 별도 과금되며, 출력 단가가 더 높은 경우가 일반적입니다.
입력 token이란? prompt, 시스템 프롬프트, 대화 기록, 도구(function) 반환값이 컨텍스트에 기록된 분, 일부 모델의 「사고 / reasoning」token(입력 측에 산정되는 경우). 출력 token이란? 모델이 생성해 반환하는 텍스트(및 일부 API 모드에서 별도 과금되는 reasoning 출력).
예: 어떤 모델이 입력 $3/100만, 출력 $15/100만일 때, 1회 요청 10,000 입력 + 2,000 출력 token:
- 입력: 10,000 ÷ 1,000,000 × $3 = $0.03
- 출력: 2,000 ÷ 1,000,000 × $15 = $0.03
- inference 합계: $0.06(충전 수수료 미포함)
OpenRouter API는 OpenAI Chat Completions와 호환되며, 응답에 보통 usage.prompt_tokens와 usage.completion_tokens가 포함되어 앱 내에서 실시간 비용 추정이 가능합니다.
놓치기 쉬운 숨은 비용
모델 목록의 token 단가는 「바닥 가격」에 불과합니다. OpenRouter 공식 요금에 따르면 실제 총비용에는 다음 층이 추가됩니다.
| 비용 층 | 비율 / 규칙 | 발생 조건 |
|---|---|---|
| Inference(token) | 각사 공개가 그대로 전달 | 각 API 호출 |
| 신용카드 충전 플랫폼 수수료 | 5.5%(최소 수수료 있음) | 카드로 credits 구매할 때마다 |
| 암호화폐 충전 | 약 5% | 암호화폐 top-up |
| BYOK 초과 요금 | OpenRouter 가격 상당 5% | 자체 Key 사용 시 월간 무료 한도 초과(표준 약 100만 요청/월) |
| 대량 할인 | 월간 소비 달성 시 최대 약 7% off | Gold / Platinum 등급(월간 기준 약 $1K / $5K) |
따라서 소규모 팀 예산은 위 표 inference에 5–7% overhead를 더해야 합니다. 예를 들어 $100 충전 시 5.5% 플랫폼 수수료를 제외한 실효 credits는 약 $94.5, 이후 모델 단가로 token이 차감됩니다.
또 한 가지: OpenRouter는 주요 모델에서 token 단가에 2차 마크업을 하지 않습니다(각사 공식과 동일). 이 점이 일부 집약 플랫폼과 다릅니다. 「비싸다」고 느끼는 것은 주로 충전 마찰과 멀티모델 편의성의 트레이드오프이지, token마다 몰래 가격을 올리는 것이 아닙니다.
2026 단가표: Claude vs GPT-5 vs Gemini
아래 표는 2026년 7월 OpenRouter에 게시된 대표 모델 요금(미국 달러 / 100만 token)입니다. 수치는 각사 인상에 따라 변동하므로 이용 전 모델 페이지 실시간 가격을 확인하세요.
Anthropic Claude 시리즈
| 모델(OpenRouter ID 예) | 입력 / 100만 | 출력 / 100만 | 포지셔닝 |
|---|---|---|---|
Claude Opus 5 anthropic/claude-opus-5 |
$5.00 | $25.00 | 플래그십 추론, 복잡 Agent, 장시간 코딩 |
Claude Sonnet 4.6 anthropic/claude-sonnet-4.6 |
$3.00 | $15.00 | 일상 코딩·프로덕트 주력, 가성비 정석 |
Claude Haiku 4.5 anthropic/claude-haiku-4.5 |
$1.00 | $5.00 | 분류, 라우팅, 경량 완성 |
Claude는 OpenRouter에서 Prompt Caching을 지원합니다. 반복 전송하는 큰 컨텍스트(시스템 프롬프트, 긴 문서)가 캐시 히트하면 실효 입력 단가가 크게 내려갑니다. OpenRouter 모델 페이지의 「Effective Pricing」이동 평균에서는 사용자에 따라 표시 가격보다 60–80% 저렴해지기도 합니다.
OpenAI GPT-5 시리즈
| 모델(OpenRouter ID 예) | 입력 / 100만 | 출력 / 100만 | 포지셔닝 |
|---|---|---|---|
GPT-5.5 openai/gpt-5.5 |
$5.00 | $30.00 | 플래그십 멀티모달·복잡 작업 |
GPT-5.4 openai/gpt-5.4 |
$2.50 | 약 $10–15 | 성능과 비용 균형 주력 |
GPT-5.4 Mini openai/gpt-5.4-mini |
약 $0.15–0.40 | 약 $0.60–1.60 | 고동시·단순 작업 |
GPT-5 시리즈는 OpenRouter에서 출력 단가가 동급 Claude보다 높은 경향이 있습니다(예: GPT-5.5 출력 $30 vs Opus 5 출력 $25). 앱에서 출력이 길면(장문 생성, 대량 코드 완성) OpenAI 플래그십 총액이 더 비쌀 수 있습니다.
Google Gemini 시리즈
| 모델(OpenRouter ID 예) | 입력 / 100만 | 출력 / 100만 | 포지셔닝 |
|---|---|---|---|
Gemini 3.1 Pro google/gemini-3.1-pro-preview |
$2.00 | $12.00 | 긴 컨텍스트, 멀티모달 Pro |
Gemini 3.5 Flash google/gemini-3.5-flash |
약 $0.10–0.35 | 약 $0.40–1.40 | 저지연, 대량 처리 |
Gemini 3 Flash google/gemini-3-flash-preview |
약 $0.10–0.25 | 약 $0.40–1.00 | 경량 대화·도구 호출 |
같은 「플래그십 Pro」급에서 Gemini 3.1 Pro 입력은 Claude Opus 5의 약 40%, 출력은 약 48%로, 표면상 가장 경쟁력 있습니다. 「충분한가」는 가격만이 아니라 작업 품질 요건에 달려 있습니다.
4가지 실전 시나리오 비용 계산
아래는 동일 공식으로 1회 inference를 추산합니다(5.5% 충전 수수료 미포함). 비교용 3모델: Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro.
시나리오 A: 짧은 대화(고객 지원 / Q&A)
약 2,000 입력 + 500 출력 token.
| 모델 | 입력 비용 | 출력 비용 | 1회 합계 |
|---|---|---|---|
| Sonnet 4.6($3 / $15) | $0.006 | $0.0075 | $0.0135 |
| GPT-5.4($2.5 / $12) | $0.005 | $0.006 | $0.011 |
| Gemini 3.1 Pro($2 / $12) | $0.004 | $0.006 | $0.010 |
짧은 대화에서는 차이가 작습니다. 하루 1만 회 규모에서도 Gemini와 GPT-5.4가 약간 저렴하지만 절대액은 여전히 낮습니다.
시나리오 B: 코드 리뷰(중간 컨텍스트)
약 50,000 입력(diff + 관련 파일 포함) + 2,000 출력(리뷰 의견).
| 모델 | 1회 합계 |
|---|---|
| Sonnet 4.6 | $0.18($0.15 + $0.03) |
| GPT-5.4 | $0.149 |
| Gemini 3.1 Pro | $0.124 |
시나리오 C: 터미널 Agent 1세션(저장소 대량 읽기)
약 200,000 입력 + 10,000 출력——Claude Code / Cursor Agent 1라운드 심층 작업 상한에 가까운 규모.
| 모델 | 1회 합계 |
|---|---|
| Sonnet 4.6 | $0.75 |
| GPT-5.4 | $0.62 |
| Gemini 3.1 Pro | $0.52 |
| Claude Opus 5($5 / $25) | $1.25 |
| GPT-5.5($5 / $30) | $1.30 |
Agent 시나리오에서는 입력 token이 청구를 지배합니다. 이 규모를 하루 20라운드 돌리면 Sonnet 4.6 inference만 약 $15/일 ≈ $450/월——그래서 많은 사람이 순수 API 대신 구독(Claude Code Max 등)을 선택하고, 사용량이 구독 상한을 넘을 때까지 씁니다.
시나리오 D: 배치 요약(100건 × 8K 입력 + 300 출력)
총 입력 800,000 + 출력 30,000 token.
- Sonnet 4.6: 약 $2.85
- GPT-5.4: 약 $2.36
- Gemini 3.1 Pro: 약 $1.96
- Gemini 3.5 Flash로 전환: 한 자릿수 더 저렴해지는 경우도, 품질 요건 낮은 파이프라인용
월간 사용량: 무엇이 가장 저렴한가
팀 월간 소비가 50M 입력 + 5M 출력 token(중형 Agent 제품에서 흔한 구간)일 때 각 모델 inference 비교:
| 모델 | 월간 inference 추산 |
|---|---|
| Claude Opus 5 | $50×5 + $25×5 = $375 |
| Claude Sonnet 4.6 | $3×50 + $15×5 = $225 |
| GPT-5.5 | $5×50 + $30×5 = $400 |
| GPT-5.4 | $2.5×50 + $12×5 = $185 |
| Gemini 3.1 Pro | $2×50 + $12×5 = $160 |
5.5% 충전 수수료를 더하면 Gemini 3.1 Pro는 약 $169/월, Sonnet 4.6은 약 $237/월, GPT-5.5는 약 $422/월. 표면상 최저는 종종 Gemini Pro 또는 Flash. 코딩 Agent에서는 Sonnet이 여전히 많은 팀의 품질 기준.
구독 제품과 대조
개인용 Claude Pro(약 $20/월)나 Max 5x($100/월)는 Claude Code와 Web 사용량 풀을 포함하며, API token 과금과는 별개입니다. 월간 API 청구가 안정적으로 $100–200을 넘고 Claude Code 연동이 불필요하면 OpenRouter + 선택 모델이 더 유연합니다. 반대 터미널 Agent 헤비 유저는 구독이 더 나을 수 있습니다.
OpenRouter vs 직연결 API
| 관점 | OpenRouter | 직연결 Anthropic / OpenAI / Google |
|---|---|---|
| Token 단가(주요 모델) | 보통 각사와 동일 | 각사 표시가. 엔터프라이즈 계약 할인 가능 |
| 추가 플랫폼 비용 | 충전 5.5% 등 | 없음(또는 청구서 결제) |
| 멀티모델 전환 | model 파라미터만 변경 |
여러 SDK / 키 / 과금 계정 |
| Failover / 라우팅 | 다중 프로바이더 라우트 내장 | 자체 구축 필요 |
| 컴플라이언스·데이터 위치 | OpenRouter 경유. DPA 평가 필요 | 리전·컴플라이언스 플랜 직접 선택 가능 |
권장: 단일 모델·월 $5K 초과·엔터프라이즈 가격 협상 가능 → 직연결 우선. 프로토타입, 멀티모델 A/B, 소규모 팀 통합 게이트웨이 → OpenRouter의 시간 가치가 5% 수수료를 상쇄하는 경우가 많습니다.
비용 절감: 캐싱, Batch, 모델 라우팅
- Prompt Caching: Claude의 긴 시스템 프롬프트나 고정 문서를 반복 전송할 때 OpenRouter가 캐시 할인을 그대로 전달해 실효 입력 단가를 크게 낮출 수 있습니다.
- 모델 라우팅: Haiku / Flash로 의도 분류와 초안을 하고 복잡한 단계만 Sonnet / Pro로 승격——평균 단가를 50% 이상 낮출 수 있습니다.
- 컨텍스트 압축: Agent에서는 1회 읽는 파일 수를 제한하고 대화 기록을 요약하는 것이 플래그십 모델 변경보다 효과적인 경우가 많습니다.
- Batch API: 비실시간 작업은 각사 Batch(일부 모델은 OpenRouter에 대응 라우트 있음)를 이용. 보통 큰 할인이 있습니다.
- usage 모니터링: 앱 계층에서 각 호출의
prompt_tokens/completion_tokens를 기록하고 기능별로 배분. 「어디서 돈이 새는지 모름」을 방지합니다.
Agent가 Mac에서 xcodebuild, 서명, TestFlight도 돌린다면 모델 청구 외에 실행 환경 비용도 있습니다. 클라우드 Mac과 iOS 툴체인을 참고해 빌드 환경과 API 비용을 분리해 계획하세요.
자주 묻는 질문
OpenRouter는 모델 단가에 마크업을 하나요?
OpenRouter는 주요 모델의 token 단가를 각사 공개가로 보통 그대로 전달하며 inference에 추가 마크업을 하지 않습니다. 다만 실제 총비용에는 신용카드 충전 5.5% 플랫폼 수수료(최소 금액 별도), BYOK가 월간 무료 한도를 초과할 때 5%가 추가됩니다.
OpenRouter는 1회 API 호출 비용을 어떻게 계산하나요?
비용 =(입력 token 수 ÷ 1,000,000 × 입력 단가)+(출력 token 수 ÷ 1,000,000 × 출력 단가). 입력에는 prompt, 대화 기록, 도구 반환값이 컨텍스트에 기록된 분이 포함됩니다. 출력은 모델이 생성한 token. 두 단가는 다르며 출력이 더 비싼 경우가 일반적입니다.
2026년 OpenRouter에서 Claude, GPT-5, Gemini 중 무엇이 더 저렴한가요?
동급 비교 시 Gemini 3.1 Pro 입력은 약 $2/100만, 출력은 약 $12/100만으로 Claude Opus 5(약 $5/$25)와 GPT-5.5(약 $5/$30)보다 보통 저렴합니다. 그러나 Agent에서는 입력 token이 출력을 크게 앞서는 경우가 많아 실제 입력/출력 비율로 계산해야 하며 입력 단가만 보면 안 됩니다.
OpenRouter와 Anthropic / OpenAI API 직연결, 어느 쪽이 더 이득인가요?
단일 모델·고사용량·엔터프라이즈 계약이나 선불 할인이 가능하면 직연결이 종종 더 저렴합니다. 멀티모델 라우팅, 통합 OpenAI 호환 인터페이스, 자동 failover, 빠른 모델 시험이 필요하면 OpenRouter 편의성이 약 5–7% 충전 overhead를 상쇄할 수 있습니다.
빠른 결론
- 과금 핵심: 입력 + 출력 token 별도 계산. Agent에서는 입력이 대부분을 차지하는 경우가 많음
- 플랫폼 비용: 충전 약 +5.5%. 예산을 모델 표시가만으로 잡지 말 것
- 단가: 플래그십에서 Gemini 3.1 Pro가 보통 최저, GPT-5.5 출력이 가장 비쌈
- 선정: 멀티모델 / 빠른 반복 → OpenRouter. 단일·고사용량 → 직연결 + 엔터프라이즈 할인
API는 모델, 클라우드 Mac은 빌드
OpenRouter는 「어떤 LLM을 호출할지」를 해결합니다. iOS / macOS 파이프라인에는 여전히 동작하는 Xcode 환경이 필요합니다. Zilmac 클라우드 Mac은 Agent 워크플로와 함께 서명, 공증, TestFlight를 처리하기에 적합합니다.
물리 Mac 없이 안정된 환경에서 Apple 툴체인을 실행. — 클라우드 Mac 요금제 보기