생성형 AI 도입 논의에서 "유럽 규제 때문에 외부 클라우드 모델은 쓰기 어렵다"는 말이 나오는 순간, 결정의 무게중심이 컴플라이언스 팀으로 넘어가는 경향이 있다. 그런데 규제 리스크를 회피하는 데 성공해도, 인프라를 자체 구축·운영하는 비용이 예상보다 훨씬 크면 애초의 목적이 흐려진다. 이 글은 로컬 LLM 도입을 검토하는 프로덕트 매니저와 기술 의사결정자가 실제로 비교해야 할 축을 세우고, 각 선택지의 장단점과 적합 조건을 대조한다.
비교의 기준점으로는 Aleph Alpha가 2026년 10월 공개한 오픈웨이트 모델 콜리브리(Kolibri)를 사용한다. 독일 팀이 독일·핀란드 인프라에서 학습시키고 Apache 2.0 라이선스로 배포한 78B 파라미터 규모의 MoE(Mixture of Experts) 모델이다. 규제 측면에서는 EU AI법을 염두에 두고 설계했고, EU의 범용 AI 행동 강령에도 서명했다. 이 모델이 흥미로운 이유는 규제 적합성과 오픈웨이트 배포, 독일어 성능이라는 세 가지 조건을 동시에 주장하는 첫 사례 중 하나이기 때문이다.
먼저 정해야 할 것: 규제 회피가 요구사항인가, TCO 최소화가 요구사항인가
이 둘은 같은 방향을 가리키는 것처럼 보이지만, 실제로는 서로 다른 의사결정 경로를 만든다.
규제 회피가 진짜 요구사항이라면 데이터가 유럽 외부로 나가지 않아야 하고, 모델 제공자가 언제든 서비스를 중단하거나 조건을 바꿀 수 없어야 하며, 학습 데이터와 파이프라인의 법적 관할권이 명확해야 한다. 콜리브리는 이 세 조건을 모두 충족한다고 주장하며, 오픈웨이트이므로 제공자가 서비스를 중단해도 가중치를 계속 쓸 수 있다.
TCO 최소화가 진짜 요구사항이라면 질문이 달라진다. GPU 구매 또는 임차 비용, 운영 인력, 추론 속도, 유지보수 주기, 그리고 기회비용까지 계산해야 한다. 규제 요건이 실제로 강제되는 조직이라면 클라우드 기반 모델을 아예 선택할 수 없으므로 비교 자체가 성립하지 않는다. 그 경우 논의는 어떤 로컬 모델을 선택할 것인가로 좁혀진다. 반면 규제 위험이 잠재적이거나 해석 여지가 있다면, 컴플라이언스 비용과 인프라 구축 비용을 모두 계산에 넣어야 한다.
MoE 구조가 TCO에 미치는 영향
콜리브리의 구조적 특성은 비용 계산에 직접 영향을 준다. 콜리브리는 총 78B 파라미터를 가지지만, 토큰 하나를 처리할 때 실제로 사용하는 파라미터는 약 3.46B에 불과하다. MoE 구조에서 각 토큰은 수백 개의 전문 서브네트워크 중 소수만 활성화하기 때문이다.
연산 측면에서는 유리하다. 추론 속도는 실제 활성 파라미터 수에 가깝게 동작하므로, 78B 규모의 밀집형(dense) 모델보다 빠르게 응답을 생성할 수 있다. 그러나 메모리 측면에서는 사정이 다르다. MoE 구조에서는 토큰 처리 시 일부 파라미터만 쓰더라도 전체 가중치를 메모리에 올려둬야 한다. FP8 기준으로 약 78GB의 GPU 메모리가 필요하다는 뜻이다. NVIDIA B200 수준의 GPU를 여러 장 확보해야 하고, 이것이 초기 인프라 비용의 핵심 변수가 된다.
클라우드 API 기반 모델과 비교하면 이 구조적 차이가 비용 곡선을 어떻게 바꾸는지 볼 수 있다.
| 비교 항목 | 클라우드 API 모델 | 콜리브리(온프레미스) |
|---|---|---|
| 초기 비용 | 낮음(사용량 기반) | 높음(GPU 구매·임차) |
| 단위 추론 비용 | 사용량에 비례 | 고정 인프라 분산 |
| 메모리 요구 | 없음(API 호출) | ~78GB GPU 메모리 |
| 데이터 주권 | 제공자 약관 의존 | 자체 통제 |
| 모델 업데이트 | 공급자 결정 | 자체 시점 결정 |
| 독일어 토큰 효율 | GPT-5 대비 약 18% 더 많은 토큰 사용 | 기준선 |
토큰 효율 항목은 비용과 직결된다. 알레프 알파의 측정에 따르면 콜리브리의 토크나이저는 GPT-5가 사용하는 토크나이저보다 독일어 텍스트를 약 11% 더 적은 토큰으로 처리한다. API 기반 모델에서는 토큰 수가 곧 비용이므로, 독일어 중심 업무량이 많을수록 이 차이가 누적된다. 독일어 법령 텍스트를 예로 들면, 같은 문서를 GPT 계열 토크나이저로 처리할 때와 콜리브리 토크나이저로 처리할 때 토큰 수 차이가 약 18% 가까이 벌어진다는 실험 결과가 있다.
어떤 조건에서 로컬 구축이 유리한가
단순하게 말하면, 요청량이 충분히 많고 충분히 지속적일 때 인프라 고정비가 분산된다. 그 임계점이 어디인지는 조직의 GPU 조달 비용, 전력비, 운영 인력 수준에 따라 다르다. 따라서 여기서 특정 숫자를 제시하기보다는, 의사결정자가 자체적으로 계산해야 할 변수 목록을 정리하는 것이 더 정직하다.
로컬 구축이 유리한 방향으로 움직이는 조건은 다음과 같다.
- 일일 추론 요청이 수만 건 이상으로 안정적으로 발생하며, 클라우드 API 비용이 이미 월 단위로 유의미한 예산을 차지하고 있다.
- 처리하는 텍스트가 독일어 비중이 높고, 법률·행정·의료 등 전문 용어가 많다. 토큰 효율 차이가 실질 비용 절감으로 연결된다.
- 데이터를 외부에 전송하면 내부 정책 또는 계약상 제약이 발생하는 업무가 핵심 사용 사례다.
- 모델 버전을 자체 일정에 맞춰 고정하거나 파인튜닝해야 하는 필요가 있다. 오픈웨이트이므로 가중치를 직접 수정할 수 있다.
반대로 클라우드 API가 여전히 합리적인 선택인 경우도 있다.
- 초기 개념 검증(PoC) 단계이거나 사용량이 불규칙하다. GPU 인프라의 고정비를 정당화하기 어렵다.
- ML 운영 역량이 팀 내부에 없다. 모델 서빙, 버전 관리, 장애 대응을 외부에 위임하는 비용이 API 비용보다 낮을 수 있다.
- 독일어 이외의 다국어 지원이 주요 요건이다. 콜리브리는 독일어와 영어에 특화되어 있으며, 다른 언어에 대한 성능은 별도로 검증해야 한다.
성능 주장을 검증할 때 주의할 점
알레프 알파는 콜리브리가 같은 규모의 모델 중 독일어·영어 양쪽에서 비교 대상 모든 모델을 앞선다고 밝혔다. 이 주장은 자사 평가 기준에 따른 것이다. 외부 독립 벤치마크가 아직 충분히 축적되지 않은 시점에서, 이 수치를 그대로 구매 근거로 삼는 것은 이르다.
성능 주장을 실제 업무에 적용하기 전에 확인해야 할 것들이 있다.
첫째, 어떤 태스크에서 우위가 나타나는가. 벤치마크 순위와 실제 업무 성능은 다를 수 있다. 조직이 주로 쓰는 업무 유형, 예컨대 요약, 분류, 질의응답, 코드 생성 등으로 직접 테스트해야 한다.
둘째, 추론 깊이 설정이 비용에 영향을 준다. 콜리브리는 추론 수준을 없음·낮음·중간·높음의 4단계로 조정할 수 있다. 추론 깊이가 높을수록 응답 품질이 올라갈 수 있지만, 처리 시간과 연산 비용도 함께 올라간다. 어떤 업무에 어떤 수준을 적용할지 사전에 정해두지 않으면 운영 비용 예측이 어려워진다.
셋째, 학습 데이터 구성의 한계를 파악해야 한다. 알레프 알파는 훈련 데이터에 외부 모델을 활용했음을 공개했다. 영어 웹 텍스트는 Google의 Gemma 4로 재작성했고, 독일어 텍스트는 Mistral-NeMo를 활용했으며, 품질 필터 레이블링에 Qwen3-32B를 사용했다. 완전히 자체 생산한 학습 파이프라인이 아니라는 점을 법적 또는 조달 기준으로 따져야 하는 조직은 이 부분을 별도로 검토해야 한다.
인프라 조달 전에 먼저 시험해야 하는 순서
GPU 서버를 구매하거나 장기 임차 계약을 맺기 전에 단계를 밟아두면 잘못된 투자를 줄일 수 있다.
가중치는 Hugging Face에 공개되어 있으므로 클라우드 GPU 인스턴스를 단기 임차해 실제 업무 데이터로 성능을 먼저 검증한다. 이 단계에서 데이터를 외부 클라우드에 올리는 것이 내부 정책상 문제가 되면, 익명화하거나 합성 데이터를 만들어 대체하는 방법도 있다.
성능 검증이 끝나면 그다음으로 운영 비용을 계산한다. 실제 요청량을 기준으로 GPU 인스턴스 비용과 API 비용을 비교하면, 손익분기점이 어디인지 숫자로 확인할 수 있다. 이 숫자 없이 온프레미스 구축을 결정하면 나중에 비용 정당화가 어려워진다.
마지막으로 ML 운영 역량을 내부에서 확보할 수 있는지 점검한다. 모델 서빙 파이프라인 구축, 버전 고정, 장애 복구, 파인튜닝 운영을 담당할 인력이 없다면 도입 이후 실질 운영 비용이 초기 예상보다 커질 가능성이 높다.