article · 2026-04-17

경량 LLM 앙상블 — Gemma 4 E4B와 택소노미 라벨링에 적합한 모델 조합 전략

단일 소형 모델로 Intent Labeling을 돌리면 오류 패턴이 모델에 고착된다. 어떤 모델과 조합해야 그 고착이 풀리는가.


§1. 문제 — 라벨링 태스크에서 소형 모델의 오류 구조

Intent Labeling은 분류 태스크다. 모델이 발화를 받아 Taxonomy에 정의된 Intent 코드를 할당한다. 단일 모델로 충분해 보이지만, 실제로는 세 종류의 오류가 다른 원인에서 발생한다.

라벨링 오류의 3-Pattern:

오류 유형원인특성
Wrong Label의미 이해 실패모델이 발화를 오해, 엉뚱한 intent 할당
Ambiguous BoundaryTaxonomy 경계 케이스두 intent 중 어디에 속하는지 판단 불가
OOS (Out-of-Scope)미등록 intentTaxonomy에 없는 발화를 억지로 기존 코드에 매핑

세 오류는 서로 다른 보완 전략을 요구한다. Wrong Label은 의미 이해력이 다른 모델로, Ambiguous Boundary는 Taxonomy 구조를 다르게 인식하는 모델로, OOS는 "거부 응답" 패턴을 학습한 모델로 보완된다. 단일 모델은 이 세 가지를 동시에 커버하지 못한다.


§2. Gemma 4 E4B 프로파일 — 라벨링 관점

Gemma 4 E4B는 Google DeepMind가 2026년 4월 공개한 에지 최적화 모델이다[1].

핵심 스펙:

항목값
Effective parameters4.5B
Total parameters (임베딩 포함)~8B
아키텍처Dense + PLE (Per-Layer Embeddings)
Context128K tokens
입력 모달텍스트, 이미지, 오디오
Fine-tuning단일 소비자 GPU에서 LoRA/QLoRA 가능
배포Ollama, llama.cpp, MLX 지원

PLE(Per-Layer Embeddings)란: 전통적인 MoE 라우팅 없이 레이어별 임베딩을 분리해 활성 연산을 줄이는 방식이다. 토큰당 4.5B만 활성화하지만 MoE가 아니기 때문에 라우팅 오버헤드가 없고, Dense 모델과 같은 추론 경로를 유지한다.

라벨링 태스크에서의 강점:

  • 구조적 출력 준수 (Taxonomy 코드 형식 따르기)

  • 짧은 발화에서 빠른 추론

  • 멀티모달 입력으로 음성 utterance 직접 처리 가능

라벨링 태스크에서의 약점:

  • 다국어 utterance: 201개 언어 수준의 커버리지 없음

  • Ambiguous Boundary: 단일 Google alignment 관점에서 경계 케이스를 일관되게 오분류할 위험

  • OOS 감지: 미등록 intent를 강제 매핑하는 경향


§3. 4축 Taxonomy 기반 보완 모델 선택

v2에서 정립한 4축 분류 체계[2]로 E4B의 보완 모델을 도출한다. 목표는 E4B가 실패하는 오류 패턴을 다른 모델이 커버하는 것이다.

3.1 보완 후보 분석

Qwen3.5-4B[3]

축Gemma 4 E4BQwen3.5-4B보완 여부
ArchitectureDense + PLEHybrid (Gated DeltaNet + MoE)✓ 다름
TrainingGoogle internalAlibaba DPO✓ 다름
CapabilityGeneral/ReasoningMultilingual (201개 언어)✓ 다름
Size4.5B effective~4B active유사

Gated DeltaNet은 레이어의 약 75%가 선형 어텐션으로 동작한다. 소프트맥스 어텐션과 다른 내부 표현을 형성하기 때문에 E4B와 CKA 유사도가 낮다. 특히 다국어 발화와 코드스위칭 utterance에서 오류 패턴이 E4B와 다르게 나타난다.

Phi-4-mini[4]

축Gemma 4 E4BPhi-4-mini보완 여부
ArchitectureDense + PLEDense (GQA, 200K vocab)유사
TrainingGoogle internalSFT + DPO + RLHF (Microsoft)✓ 다름
CapabilityGeneral/ReasoningStructured reasoning, Math부분 다름
Size4.5B effective3.8B유사

아키텍처 축에서는 겹치지만, Training 축의 차이가 크다. Microsoft의 합성 데이터 기반 학습과 Google alignment는 Taxonomy 경계 케이스에서 다른 판단을 내리는 경향이 있다. Phi-4-mini는 특히 구조화된 지시문 준수와 OOS 판단("이 발화는 기존 intent에 해당하지 않음")에서 강점을 보인다.

3.2 보완 모델 선택 결론

모델커버하는 오류 유형보완 강도
Qwen3.5-4BWrong Label (다국어), Ambiguous Boundary아키텍처 + Training + Capability 3축 분산
Phi-4-miniAmbiguous Boundary, OOS 감지Training + alignment 방식 분산

§4. 앙상블 설계 — Disagreement 기반 HITL 라우팅

4.1 오류 유형별 앙상블 전략

Intent Labeling은 분류 태스크이므로 Majority Voting이 기본이다. 그러나 Taxonomy 라벨링의 핵심 문제는 단순 다수결로 해결되지 않는 경계 케이스다. 두 모델이 다른 라벨을 내면 그 자체가 경계 케이스라는 신호다.

Disagreement Rate를 HITL 트리거로 활용:

연구에 따르면 소형 LLM 앙상블은 단일 모델 대비 OOS 감지 F1-score를 5% 이상 개선하고[5], 텍스트 분류 정확도를 78% → 86%까지 끌어올린다[6]. 핵심은 불일치를 정보로 사용하는 것이다.

4.2 3단계 파이프라인

[Stage 1] 병렬 추론
  Gemma 4 E4B   →  label_A, confidence_A
  Qwen3.5-4B    →  label_B, confidence_B

[Stage 2] 동의/불일치 판정
  label_A == label_B
    → 확정 라벨 (신뢰도 평균 > 임계값 시)
  label_A != label_B
    → Stage 3으로 에스컬레이션

[Stage 3] 중재 또는 HITL
  confidence 차이 작음  →  Phi-4-mini 중재 추론
  confidence 차이 큼    →  HITL 큐 (사람 판정)

임계값 설정 기준:

  • 동의 + 고신뢰(>0.85): 자동 확정

  • 동의 + 저신뢰(<0.85): Phi-4-mini 검증

  • 불일치 + confidence 차이 < 0.2: Phi-4-mini 중재

  • 불일치 + confidence 차이 ≥ 0.2: HITL 에스컬레이션

4.3 Taxonomy A×O×C 분해와 불일치 패턴

Intent Taxonomy를 A(Action) × O(Object) × C(Context)로 분해하면, 불일치는 O 축에서 가장 자주 발생한다. "취소해줘"라는 발화에서 A(취소)는 두 모델이 동의하지만, O(무엇을 취소하나)에서 갈린다. 이 패턴이 감지되면 O 축 명시를 요구하는 HITL 질의를 생성할 수 있다.

불일치 분석:
  A축 동의 + O축 불일치  →  "Object 불명확" HITL 질의
  A축 불일치             →  "Action 불명확" 또는 OOS 검토
  전체 불일치            →  OOS 우선 검토

§5. 비용-성능 분석

5.1 배포 시나리오별 구성

시나리오구성예상 정확도비용
최소 비용Gemma 4 E4B × 3 (Majority Voting)단일 대비 +3-5%[7]최저 (동일 모델 3배)
권장E4B + Qwen3.5-4B + Phi-4-mini 중재경계 케이스 커버중
HITL 통합E4B + Qwen3.5-4B → Disagreement → HITL최고 (사람 개입)중-고

5.2 하드웨어 요건

모델VRAM (Q4)병렬 구동
Gemma 4 E4B~4GB✓
Qwen3.5-4B~3GB✓
Phi-4-mini~3GB✓
합계 (동시 구동)~10GB단일 16GB GPU 가능

세 모델 모두 단일 16GB VRAM GPU에서 동시 구동 가능하다. 소비자용 RTX 4080 이상 또는 M3 Pro MacBook에서 로컬 완전 자립 구성이 된다.

5.3 Cascade 최적화

발화의 난이도 분포가 편향적일 때(쉬운 발화 >60%) Cascade가 효율적이다:

[1차] Gemma 4 E4B 단독
  confidence > 0.90  →  확정 (전체의 ~60% 처리)
  confidence ≤ 0.90  →  2차로 넘김

[2차] Qwen3.5-4B 추가 추론
  동의              →  확정
  불일치            →  Phi-4-mini 또는 HITL

FrugalGPT 방식의 cascade는 동등 품질에서 평균 추론 비용을 40-60% 절감한다[8].


§6. 이론적 한계와 열린 질문

  1. PLE vs MoE 다양성: E4B의 PLE와 Qwen3.5-4B의 Gated DeltaNet이 실제로 다른 오류 패턴을 만드는지는 Intent Labeling 특화 벤치마크가 아직 없다. Disagreement Rate를 도메인 probe set으로 측정하는 사전 검증이 필요하다.

  2. Taxonomy 크기 의존성: Taxonomy가 소규모(< 50 intent)이면 단일 모델로도 충분할 수 있다. 앙상블 효과는 Taxonomy가 클수록, 계층이 깊을수록 두드러진다.

  3. Fine-tuning vs Ensemble 선택: E4B는 단일 GPU에서 LoRA fine-tuning이 가능하다. 도메인 데이터가 충분하다면 fine-tuning된 단일 모델이 앙상블보다 나을 수 있다. 두 전략은 경쟁이 아니라 조합 가능하다 — fine-tuned E4B + zero-shot Qwen3.5-4B 앙상블.

  4. 동일 발화 언어 편향: Qwen3.5-4B의 다국어 강점은 비영어 발화에서만 발현된다. 단일 언어 한국어 환경이라면 다국어 다양성의 이점이 줄어든다.


각주

[1]: Google DeepMind (2026). Gemma 4: Byte for byte, the most capable open models. https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/

[2]: 본 시리즈 v2 — 경량 LLM 앙상블: 다양성 기반 모델 조합 전략 (2026-04-17). 로컬 파일 참조.

[3]: Alibaba Cloud Community (2026). Qwen3.5: Towards Native Multimodal Agents. https://www.alibabacloud.com/blog/qwen3-5-towards-native-multimodal-agents_602894

[4]: Microsoft (2025). Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs. https://arxiv.org/html/2503.01743v1

[5]: arXiv (2024). Intent Detection in the Age of LLMs. https://arxiv.org/html/2410.01627v1

[6]: ScienceDirect (2025). Exploring Zero-Shot SLM ensembles as an alternative to LLMs for sentiment analysis. 검증 가능한 공개 출처 없음 (DOI 페이지 접근 제한).

[7]: arXiv:2511.15714 (2025). Majority Rules: LLM Ensemble is a Winning Approach for Content Categorization. https://arxiv.org/abs/2511.15714

[8]: Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. TMLR. https://arxiv.org/abs/2305.05176