article · 2026-04-17
경량 LLM 앙상블 — Gemma 4 E4B와 택소노미 라벨링에 적합한 모델 조합 전략
단일 소형 모델로 Intent Labeling을 돌리면 오류 패턴이 모델에 고착된다. 어떤 모델과 조합해야 그 고착이 풀리는가.
§1. 문제 — 라벨링 태스크에서 소형 모델의 오류 구조
Intent Labeling은 분류 태스크다. 모델이 발화를 받아 Taxonomy에 정의된 Intent 코드를 할당한다. 단일 모델로 충분해 보이지만, 실제로는 세 종류의 오류가 다른 원인에서 발생한다.
라벨링 오류의 3-Pattern:
| 오류 유형 | 원인 | 특성 |
|---|---|---|
| Wrong Label | 의미 이해 실패 | 모델이 발화를 오해, 엉뚱한 intent 할당 |
| Ambiguous Boundary | Taxonomy 경계 케이스 | 두 intent 중 어디에 속하는지 판단 불가 |
| OOS (Out-of-Scope) | 미등록 intent | Taxonomy에 없는 발화를 억지로 기존 코드에 매핑 |
세 오류는 서로 다른 보완 전략을 요구한다. Wrong Label은 의미 이해력이 다른 모델로, Ambiguous Boundary는 Taxonomy 구조를 다르게 인식하는 모델로, OOS는 "거부 응답" 패턴을 학습한 모델로 보완된다. 단일 모델은 이 세 가지를 동시에 커버하지 못한다.
§2. Gemma 4 E4B 프로파일 — 라벨링 관점
Gemma 4 E4B는 Google DeepMind가 2026년 4월 공개한 에지 최적화 모델이다[1].
핵심 스펙:
| 항목 | 값 |
|---|---|
| Effective parameters | 4.5B |
| Total parameters (임베딩 포함) | ~8B |
| 아키텍처 | Dense + PLE (Per-Layer Embeddings) |
| Context | 128K tokens |
| 입력 모달 | 텍스트, 이미지, 오디오 |
| Fine-tuning | 단일 소비자 GPU에서 LoRA/QLoRA 가능 |
| 배포 | Ollama, llama.cpp, MLX 지원 |
PLE(Per-Layer Embeddings)란: 전통적인 MoE 라우팅 없이 레이어별 임베딩을 분리해 활성 연산을 줄이는 방식이다. 토큰당 4.5B만 활성화하지만 MoE가 아니기 때문에 라우팅 오버헤드가 없고, Dense 모델과 같은 추론 경로를 유지한다.
라벨링 태스크에서의 강점:
-
구조적 출력 준수 (Taxonomy 코드 형식 따르기)
-
짧은 발화에서 빠른 추론
-
멀티모달 입력으로 음성 utterance 직접 처리 가능
라벨링 태스크에서의 약점:
-
다국어 utterance: 201개 언어 수준의 커버리지 없음
-
Ambiguous Boundary: 단일 Google alignment 관점에서 경계 케이스를 일관되게 오분류할 위험
-
OOS 감지: 미등록 intent를 강제 매핑하는 경향
§3. 4축 Taxonomy 기반 보완 모델 선택
v2에서 정립한 4축 분류 체계[2]로 E4B의 보완 모델을 도출한다. 목표는 E4B가 실패하는 오류 패턴을 다른 모델이 커버하는 것이다.
3.1 보완 후보 분석
Qwen3.5-4B[3]
| 축 | Gemma 4 E4B | Qwen3.5-4B | 보완 여부 |
|---|---|---|---|
| Architecture | Dense + PLE | Hybrid (Gated DeltaNet + MoE) | ✓ 다름 |
| Training | Google internal | Alibaba DPO | ✓ 다름 |
| Capability | General/Reasoning | Multilingual (201개 언어) | ✓ 다름 |
| Size | 4.5B effective | ~4B active | 유사 |
Gated DeltaNet은 레이어의 약 75%가 선형 어텐션으로 동작한다. 소프트맥스 어텐션과 다른 내부 표현을 형성하기 때문에 E4B와 CKA 유사도가 낮다. 특히 다국어 발화와 코드스위칭 utterance에서 오류 패턴이 E4B와 다르게 나타난다.
Phi-4-mini[4]
| 축 | Gemma 4 E4B | Phi-4-mini | 보완 여부 |
|---|---|---|---|
| Architecture | Dense + PLE | Dense (GQA, 200K vocab) | 유사 |
| Training | Google internal | SFT + DPO + RLHF (Microsoft) | ✓ 다름 |
| Capability | General/Reasoning | Structured reasoning, Math | 부분 다름 |
| Size | 4.5B effective | 3.8B | 유사 |
아키텍처 축에서는 겹치지만, Training 축의 차이가 크다. Microsoft의 합성 데이터 기반 학습과 Google alignment는 Taxonomy 경계 케이스에서 다른 판단을 내리는 경향이 있다. Phi-4-mini는 특히 구조화된 지시문 준수와 OOS 판단("이 발화는 기존 intent에 해당하지 않음")에서 강점을 보인다.
3.2 보완 모델 선택 결론
| 모델 | 커버하는 오류 유형 | 보완 강도 |
|---|---|---|
| Qwen3.5-4B | Wrong Label (다국어), Ambiguous Boundary | 아키텍처 + Training + Capability 3축 분산 |
| Phi-4-mini | Ambiguous Boundary, OOS 감지 | Training + alignment 방식 분산 |
§4. 앙상블 설계 — Disagreement 기반 HITL 라우팅
4.1 오류 유형별 앙상블 전략
Intent Labeling은 분류 태스크이므로 Majority Voting이 기본이다. 그러나 Taxonomy 라벨링의 핵심 문제는 단순 다수결로 해결되지 않는 경계 케이스다. 두 모델이 다른 라벨을 내면 그 자체가 경계 케이스라는 신호다.
Disagreement Rate를 HITL 트리거로 활용:
연구에 따르면 소형 LLM 앙상블은 단일 모델 대비 OOS 감지 F1-score를 5% 이상 개선하고[5], 텍스트 분류 정확도를 78% → 86%까지 끌어올린다[6]. 핵심은 불일치를 정보로 사용하는 것이다.
4.2 3단계 파이프라인
[Stage 1] 병렬 추론
Gemma 4 E4B → label_A, confidence_A
Qwen3.5-4B → label_B, confidence_B
[Stage 2] 동의/불일치 판정
label_A == label_B
→ 확정 라벨 (신뢰도 평균 > 임계값 시)
label_A != label_B
→ Stage 3으로 에스컬레이션
[Stage 3] 중재 또는 HITL
confidence 차이 작음 → Phi-4-mini 중재 추론
confidence 차이 큼 → HITL 큐 (사람 판정)
임계값 설정 기준:
-
동의 + 고신뢰(>0.85): 자동 확정
-
동의 + 저신뢰(<0.85): Phi-4-mini 검증
-
불일치 + confidence 차이 < 0.2: Phi-4-mini 중재
-
불일치 + confidence 차이 ≥ 0.2: HITL 에스컬레이션
4.3 Taxonomy A×O×C 분해와 불일치 패턴
Intent Taxonomy를 A(Action) × O(Object) × C(Context)로 분해하면, 불일치는 O 축에서 가장 자주 발생한다. "취소해줘"라는 발화에서 A(취소)는 두 모델이 동의하지만, O(무엇을 취소하나)에서 갈린다. 이 패턴이 감지되면 O 축 명시를 요구하는 HITL 질의를 생성할 수 있다.
불일치 분석:
A축 동의 + O축 불일치 → "Object 불명확" HITL 질의
A축 불일치 → "Action 불명확" 또는 OOS 검토
전체 불일치 → OOS 우선 검토
§5. 비용-성능 분석
5.1 배포 시나리오별 구성
| 시나리오 | 구성 | 예상 정확도 | 비용 |
|---|---|---|---|
| 최소 비용 | Gemma 4 E4B × 3 (Majority Voting) | 단일 대비 +3-5%[7] | 최저 (동일 모델 3배) |
| 권장 | E4B + Qwen3.5-4B + Phi-4-mini 중재 | 경계 케이스 커버 | 중 |
| HITL 통합 | E4B + Qwen3.5-4B → Disagreement → HITL | 최고 (사람 개입) | 중-고 |
5.2 하드웨어 요건
| 모델 | VRAM (Q4) | 병렬 구동 |
|---|---|---|
| Gemma 4 E4B | ~4GB | ✓ |
| Qwen3.5-4B | ~3GB | ✓ |
| Phi-4-mini | ~3GB | ✓ |
| 합계 (동시 구동) | ~10GB | 단일 16GB GPU 가능 |
세 모델 모두 단일 16GB VRAM GPU에서 동시 구동 가능하다. 소비자용 RTX 4080 이상 또는 M3 Pro MacBook에서 로컬 완전 자립 구성이 된다.
5.3 Cascade 최적화
발화의 난이도 분포가 편향적일 때(쉬운 발화 >60%) Cascade가 효율적이다:
[1차] Gemma 4 E4B 단독
confidence > 0.90 → 확정 (전체의 ~60% 처리)
confidence ≤ 0.90 → 2차로 넘김
[2차] Qwen3.5-4B 추가 추론
동의 → 확정
불일치 → Phi-4-mini 또는 HITL
FrugalGPT 방식의 cascade는 동등 품질에서 평균 추론 비용을 40-60% 절감한다[8].
§6. 이론적 한계와 열린 질문
-
PLE vs MoE 다양성: E4B의 PLE와 Qwen3.5-4B의 Gated DeltaNet이 실제로 다른 오류 패턴을 만드는지는 Intent Labeling 특화 벤치마크가 아직 없다. Disagreement Rate를 도메인 probe set으로 측정하는 사전 검증이 필요하다.
-
Taxonomy 크기 의존성: Taxonomy가 소규모(< 50 intent)이면 단일 모델로도 충분할 수 있다. 앙상블 효과는 Taxonomy가 클수록, 계층이 깊을수록 두드러진다.
-
Fine-tuning vs Ensemble 선택: E4B는 단일 GPU에서 LoRA fine-tuning이 가능하다. 도메인 데이터가 충분하다면 fine-tuning된 단일 모델이 앙상블보다 나을 수 있다. 두 전략은 경쟁이 아니라 조합 가능하다 — fine-tuned E4B + zero-shot Qwen3.5-4B 앙상블.
-
동일 발화 언어 편향: Qwen3.5-4B의 다국어 강점은 비영어 발화에서만 발현된다. 단일 언어 한국어 환경이라면 다국어 다양성의 이점이 줄어든다.
각주
[1]: Google DeepMind (2026). Gemma 4: Byte for byte, the most capable open models. https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/
[2]: 본 시리즈 v2 — 경량 LLM 앙상블: 다양성 기반 모델 조합 전략 (2026-04-17). 로컬 파일 참조.
[3]: Alibaba Cloud Community (2026). Qwen3.5: Towards Native Multimodal Agents. https://www.alibabacloud.com/blog/qwen3-5-towards-native-multimodal-agents_602894
[4]: Microsoft (2025). Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs. https://arxiv.org/html/2503.01743v1
[5]: arXiv (2024). Intent Detection in the Age of LLMs. https://arxiv.org/html/2410.01627v1
[6]: ScienceDirect (2025). Exploring Zero-Shot SLM ensembles as an alternative to LLMs for sentiment analysis. 검증 가능한 공개 출처 없음 (DOI 페이지 접근 제한).
[7]: arXiv:2511.15714 (2025). Majority Rules: LLM Ensemble is a Winning Approach for Content Categorization. https://arxiv.org/abs/2511.15714
[8]: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. TMLR. https://arxiv.org/abs/2305.05176