232개 AI 모델 가격을 한눈에 — LLM 도입 비용 계산법 (costperprompt.com)
목차(4)
한줄 요약
232개 AI 모델 API 가격을 실시간으로 비교하고 월 비용까지 산출하는 도구, CostPerPrompt 분석.
무엇이 달라지나?
LLM API 비용 비교가 이제 스프레드시트 없이도 가능해졌다. CostPerPrompt는 232개 AI 모델의 입력·출력 토큰 단가를 공개 가격표 기준으로 자동 수집해 실시간으로 보여주는 서비스다. 단순 나열에 그치지 않고, 실사용 패턴을 입력하면 월 청구액으로 환산해주는 계산기까지 제공한다.
이 도구가 주목받는 이유는 모델 간 가격 격차가 생각보다 훨씬 크기 때문이다. 원문 데이터 기준으로 몇 가지 대표 수치를 보면 그 폭이 선명하게 드러난다.
| 모델 | 벤더 | 입력 (1M 토큰) | 출력 (1M 토큰) | 컨텍스트 |
|---|---|---|---|---|
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 1.1M |
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 1M |
| Claude Sonnet 5 | Anthropic | $2.00 | $10.00 | 1M |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | 1M | |
| DeepSeek V4 Pro | DeepSeek | $0.435 | $0.87 | 1M |
| DeepSeek V4 Flash 0731 | DeepSeek | $0.09 | $0.18 | 1M |
| Llama 4 Maverick | Meta | $0.20 | $0.80 | 1M |
| Qwen3 32B | Alibaba | $0.08 | $0.28 | 131K |
Claude Fable 5의 출력 단가($50.00/1M 토큰)와 DeepSeek V4 Flash의 출력 단가($0.18/1M 토큰)를 비교하면 약 278배 차이가 난다. 성능 격차가 있다 해도, 유스케이스에 따라 이 차이는 결정적이다.
주목할 또 다른 축은 중국계 모델들의 공격적인 가격 전략이다. Qwen 계열은 단일 벤더에서만 수십 개의 모델을 운용하면서, 태스크별로 세분화된 가격대를 형성하고 있다. Qwen3 32B는 입력 $0.08, Qwen3 Max는 입력 $0.78로, 동일 벤더 내에서도 10배 가까운 격차가 존재한다. 모델 선택이 곧 비용 설계라는 의미다.
실무에서 어떤 의미인가?
AI 기능을 서비스에 붙이는 순간, API 비용은 인프라 비용의 일부가 된다. 그런데 많은 팀이 PoC 단계에서는 가격을 거의 고려하지 않는다. 처음엔 트래픽이 적으니 문제가 없다가, 사용자가 늘면서 청구액이 폭발하는 구조다.
실제로 외주 개발이나 자체 개발로 AI 기능을 서비스에 통합할 때, 모델 선택은 단순히 "어떤 게 더 똑똑한가"의 문제가 아니다. 같은 태스크를 처리하더라도 모델에 따라 월 수십만 원과 수백만 원이 갈린다. 그리고 출력 토큰 단가가 입력보다 훨씬 비싸다는 구조는 변하지 않는다. GPT-5.5 기준으로 출력이 입력의 6배다.
캐싱(Cached Pricing)도 실무적으로 중요한 변수다. 반복되는 시스템 프롬프트나 문서 컨텍스트를 캐시로 처리하면 비용을 대폭 낮출 수 있다. Claude Sonnet 5의 캐시 입력 단가는 $0.20으로, 일반 입력($2.00) 대비 10분의 1 수준이다. 아키텍처 설계 단계에서 캐시 활용 여부를 고려하지 않으면 불필요한 지출이 발생한다.
컨텍스트 윈도우 크기도 선택 기준이 된다. GPT-5.5와 Claude 계열은 1M 토큰 이상의 컨텍스트를 지원하지만, Grok 4.5는 500K로 절반이다. 긴 문서를 처리하거나 대화 히스토리를 많이 유지해야 하는 서비스라면 이 수치가 병목이 될 수 있다.
도입 전 체크포인트
LLM을 서비스에 붙이기 전, 비용 관점에서 반드시 확인해야 할 항목을 정리했다.
1. 입력/출력 비율 추정 실제 서비스에서 입력과 출력의 토큰 비율을 먼저 추정해야 한다. 요약 서비스는 출력이 짧고, 코드 생성 서비스는 출력이 길다. 출력 단가가 몇 배 비싼 모델은 출력량이 많은 유스케이스에서 불리하다.
2. 월간 호출량 시나리오 작성 하루 몇 건, 건당 평균 토큰이 얼마인지 보수적·중간·공격적 시나리오로 나눠 월 비용을 계산해야 한다. CostPerPrompt의 계산기가 이 용도로 유용하다.
3. 캐싱 가능 여부 확인 시스템 프롬프트가 고정적이거나 동일 문서를 반복 참조하는 구조라면, 캐싱 지원 여부와 캐시 단가를 반드시 확인한다.
4. 태스크별 모델 분리 검토 단일 모델로 모든 기능을 처리하는 대신, 핵심 기능엔 고성능 모델을, 단순 분류나 라우팅엔 저비용 모델을 조합하는 설계가 현실적이다.
5. 가격 변동 모니터링 체계 마련 AI 모델 가격은 수시로 변한다. CostPerPrompt처럼 자동 갱신되는 도구를 통해 주기적으로 가격 변동을 추적하는 루틴이 필요하다.
자주 묻는 질문
Q.LLM API 비용이 실제 서비스에서 얼마나 커질 수 있나?
토큰 단가만 보면 낮아 보이지만, 사용자 수와 호출 빈도가 늘면 빠르게 누적된다. 특히 출력 토큰이 많은 유스케이스(코드 생성, 긴 응답 생성 등)에서는 입력 대비 수 배 비싼 출력 단가가 결정적으로 작용한다. 초기 PoC 단계에서 월 비용 시나리오를 먼저 계산하고 모델을 선택하는 순서가 바람직하다. 이후 트래픽 증가에 따라 모델을 교체하거나 조합하는 전략도 현실적으로 필요하다.
Q.DeepSeek 같은 중국계 모델을 실제 서비스에 써도 되나?
가격 경쟁력은 명확하다. DeepSeek V4 Pro의 출력 단가는 $0.87/1M 토큰으로, GPT-5.5($30.00)와 비교하면 극단적인 차이가 있다. 다만 데이터 처리 위치, 약관, 서비스 안정성, 규제 준수 여부는 팀이 별도로 검토해야 하는 요소다. 개인정보나 민감 데이터가 포함된 서비스라면 사용 전 반드시 법적 검토가 선행되어야 한다.
Q.앱 개발이나 웹 개발 외주 시 AI 기능 비용은 어떻게 책정하나?
외주 개발 계약 시 AI API 비용은 대부분 별도로 취급된다. 개발 비용과 운영 API 비용은 구조가 다르기 때문에, 사전에 예상 호출량과 모델 단가를 기반으로 월 예상 비용을 산출하고 이를 운영 예산에 반영해야 한다. 개발사와 협의 시 "어떤 모델을 기본값으로 사용할 것인지", "비용 최적화 설계를 포함할 것인지"를 명시적으로 확인하는 것이 좋다.
관련 아티클
관련 사례
이 글의 키워드와 맞닿은 실제 개발 사례를 함께 보세요.