한줄 요약
232개 AI 모델 API 가격을 실시간으로 비교하고 월 비용까지 산출하는 도구, CostPerPrompt 분석.
무엇이 달라지나?
LLM API 비용 비교가 이제 스프레드시트 없이도 가능해졌다. CostPerPrompt는 232개 AI 모델의 입력·출력 토큰 단가를 공개 가격표 기준으로 자동 수집해 실시간으로 보여주는 서비스다. 단순 나열에 그치지 않고, 실사용 패턴을 입력하면 월 청구액으로 환산해주는 계산기까지 제공한다.
이 도구가 주목받는 이유는 모델 간 가격 격차가 생각보다 훨씬 크기 때문이다. 원문 데이터 기준으로 몇 가지 대표 수치를 보면 그 폭이 선명하게 드러난다.
| 모델 | 벤더 | 입력 (1M 토큰) | 출력 (1M 토큰) | 컨텍스트 |
|---|---|---|---|---|
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 1.1M |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 1M |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 1M |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | 1M | |
| DeepSeek V4 Pro | DeepSeek | $0.435 | $0.87 | 1M |
| DeepSeek V4 Flash 0731 | DeepSeek | $0.09 | $0.18 | 1M |
| Llama 4 Maverick | Meta | $0.20 | $0.80 | 1M |
| Qwen3 32B | Alibaba | $0.08 | $0.28 | 131K |
Claude Fable 5의 출력 단가($50.00/1M 토큰)와 DeepSeek V4 Flash의 출력 단가($0.18/1M 토큰)를 비교하면 약 278배 차이가 난다. 성능 격차가 있다 해도, 유스케이스에 따라 이 차이는 결정적이다.
주목할 또 다른 축은 중국계 모델들의 공격적인 가격 전략이다. Qwen 계열은 단일 벤더에서만 수십 개의 모델을 운용하면서, 태스크별로 세분화된 가격대를 형성하고 있다. Qwen3 32B는 입력 $0.08, Qwen3 Max는 입력 $0.78로, 동일 벤더 내에서도 10배 가까운 격차가 존재한다. 모델 선택이 곧 비용 설계라는 의미다.
실무에서 어떤 의미인가?
AI 기능을 서비스에 붙이는 순간, API 비용은 인프라 비용의 일부가 된다. 그런데 많은 팀이 PoC 단계에서는 가격을 거의 고려하지 않는다. 처음엔 트래픽이 적으니 문제가 없다가, 사용자가 늘면서 청구액이 폭발하는 구조다.
실제로 외주 개발이나 자체 개발로 AI 기능을 서비스에 통합할 때, 모델 선택은 단순히 "어떤 게 더 똑똑한가"의 문제가 아니다. 같은 태스크를 처리하더라도 모델에 따라 월 수십만 원과 수백만 원이 갈린다. 그리고 출력 토큰 단가가 입력보다 훨씬 비싸다는 구조는 변하지 않는다. GPT-5.5 기준으로 출력이 입력의 6배다.
캐싱(Cached Pricing)도 실무적으로 중요한 변수다. 반복되는 시스템 프롬프트나 문서 컨텍스트를 캐시로 처리하면 비용을 대폭 낮출 수 있다. Claude Sonnet 5의 캐시 입력 단가는 $0.20으로, 일반 입력($2.00) 대비 10분의 1 수준이다. 아키텍처 설계 단계에서 캐시 활용 여부를 고려하지 않으면 불필요한 지출이 발생한다.
컨텍스트 윈도우 크기도 선택 기준이 된다. GPT-5.5와 Claude 계열은 1M 토큰 이상의 컨텍스트를 지원하지만, Grok 4.5는 500K로 절반이다. 긴 문서를 처리하거나 대화 히스토리를 많이 유지해야 하는 서비스라면 이 수치가 병목이 될 수 있다.
도입 전 체크포인트
LLM을 서비스에 붙이기 전, 비용 관점에서 반드시 확인해야 할 항목을 정리했다.
1. 입력/출력 비율 추정 실제 서비스에서 입력과 출력의 토큰 비율을 먼저 추정해야 한다. 요약 서비스는 출력이 짧고, 코드 생성 서비스는 출력이 길다. 출력 단가가 몇 배 비싼 모델은 출력량이 많은 유스케이스에서 불리하다.
2. 월간 호출량 시나리오 작성 하루 몇 건, 건당 평균 토큰이 얼마인지 보수적·중간·공격적 시나리오로 나눠 월 비용을 계산해야 한다. CostPerPrompt의 계산기가 이 용도로 유용하다.
3. 캐싱 가능 여부 확인 시스템 프롬프트가 고정적이거나 동일 문서를 반복 참조하는 구조라면, 캐싱 지원 여부와 캐시 단가를 반드시 확인한다.
4. 태스크별 모델 분리 검토 단일 모델로 모든 기능을 처리하는 대신, 핵심 기능엔 고성능 모델을, 단순 분류나 라우팅엔 저비용 모델을 조합하는 설계가 현실적이다.