Field note · 2026-04-17

경량 LLM 앙상블 — Gemma 4 E4B와 택소노미 라벨링에 적합한 모델 조합 전략

단일 소형 모델로 Intent Labeling을 돌리면 오류 패턴이 모델에 고착된다. 어떤 모델과 조합해야 그 고착이 풀리는가. Intent Labeling은 분류 태스크다. 모델이 발화를 받아 Taxonomy에 정의된 Intent 코드를 할당한다. 단일 모델로 충분해 보이지만, 실제로는 세 종류의 오류가 다른 원인에서

경량 LLM 앙상블 — Gemma 4 E4B와 택소노미 라벨링에 적합한 모델 조합 전략

단일 소형 모델로 Intent Labeling을 돌리면 오류 패턴이 모델에 고착된다. 어떤 모델과 조합해야 그 고착이 풀리는가.


§1. 문제 — 라벨링 태스크에서 소형 모델의 오류 구조

Intent Labeling은 분류 태스크다. 모델이 발화를 받아 Taxonomy에 정의된 Intent 코드를 할당한다. 단일 모델로 충분해 보이지만, 실제로는 세 종류의 오류가 다른 원인에서 발생한다.

라벨링 오류의 3-Pattern:

오류 유형원인특성
Wrong Label의미 이해 실패모델이 발화를 오해, 엉뚱한 intent 할당
Ambiguous BoundaryTaxonomy 경계 케이스두 intent 중 어디에 속하는지 판단 불가
OOS (Out-of-Scope)미등록 intentTaxonomy에 없는 발화를 억지로 기존 코드에 매핑

세 오류는 서로 다른 보완 전략을 요구한다. Wrong Label은 의미 이해력이 다른 모델로, Ambiguous Boundary는 Taxonomy 구조를 다르게 인식하는 모델로, OOS는 "거부 응답" 패턴을 학습한 모델로 보완된다. 단일 모델은 이 세 가지를 동시에 커버하지 못한다.


§2. Gemma 4 E4B 프로파일 — 라벨링 관점

Gemma 4 E4B는 Google DeepMind가 2026년 4월 공개한 에지 최적화 모델이다1.

핵심 스펙:

항목
Effective parameters4.5B
Total parameters (임베딩 포함)~8B
아키텍처Dense + PLE (Per-Layer Embeddings)
Context128K tokens
입력 모달텍스트, 이미지, 오디오
Fine-tuning단일 소비자 GPU에서 LoRA/QLoRA 가능
배포Ollama, llama.cpp, MLX 지원

PLE(Per-Layer Embeddings)란: 전통적인 MoE 라우팅 없이 레이어별 임베딩을 분리해 활성 연산을 줄이는 방식이다. 토큰당 4.5B만 활성화하지만 MoE가 아니기 때문에 라우팅 오버헤드가 없고, Dense 모델과 같은 추론 경로를 유지한다.

라벨링 태스크에서의 강점:

  • 구조적 출력 준수 (Taxonomy 코드 형식 따르기)
  • 짧은 발화에서 빠른 추론
  • 멀티모달 입력으로 음성 utterance 직접 처리 가능

라벨링 태스크에서의 약점:

  • 다국어 utterance: 201개 언어 수준의 커버리지 없음
  • Ambiguous Boundary: 단일 Google alignment 관점에서 경계 케이스를 일관되게 오분류할 위험
  • OOS 감지: 미등록 intent를 강제 매핑하는 경향

§3. 4축 Taxonomy 기반 보완 모델 선택

v2에서 정립한 4축 분류 체계2로 E4B의 보완 모델을 도출한다. 목표는 E4B가 실패하는 오류 패턴을 다른 모델이 커버하는 것이다.

3.1 보완 후보 분석

Qwen3.5-4B3

Gemma 4 E4BQwen3.5-4B보완 여부
ArchitectureDense + PLEHybrid (Gated DeltaNet + MoE)✓ 다름
TrainingGoogle internalAlibaba DPO✓ 다름
CapabilityGeneral/ReasoningMultilingual (201개 언어)✓ 다름
Size4.5B effective~4B active유사

Gated DeltaNet은 레이어의 약 75%가 선형 어텐션으로 동작한다. 소프트맥스 어텐션과 다른 내부 표현을 형성하기 때문에 E4B와 CKA 유사도가 낮다. 특히 다국어 발화와 코드스위칭 utterance에서 오류 패턴이 E4B와 다르게 나타난다.

Phi-4-mini4

Gemma 4 E4BPhi-4-mini보완 여부
ArchitectureDense + PLEDense (GQA, 200K vocab)유사
TrainingGoogle internalSFT + DPO + RLHF (Microsoft)✓ 다름
CapabilityGeneral/ReasoningStructured reasoning, Math부분 다름
Size4.5B effective3.8B유사

아키텍처 축에서는 겹치지만, Training 축의 차이가 크다. Microsoft의 합성 데이터 기반 학습과 Google alignment는 Taxonomy 경계 케이스에서 다른 판단을 내리는 경향이 있다. Phi-4-mini는 특히 구조화된 지시문 준수와 OOS 판단("이 발화는 기존 intent에 해당하지 않음")에서 강점을 보인다.

3.2 보완 모델 선택 결론

모델커버하는 오류 유형보완 강도
Qwen3.5-4BWrong Label (다국어), Ambiguous Boundary아키텍처 + Training + Capability 3축 분산
Phi-4-miniAmbiguous Boundary, OOS 감지Training + alignment 방식 분산

§4. 앙상블 설계 — Disagreement 기반 HITL 라우팅

4.1 오류 유형별 앙상블 전략

Intent Labeling은 분류 태스크이므로 Majority Voting이 기본이다. 그러나 Taxonomy 라벨링의 핵심 문제는 단순 다수결로 해결되지 않는 경계 케이스다. 두 모델이 다른 라벨을 내면 그 자체가 경계 케이스라는 신호다.

Disagreement Rate를 HITL 트리거로 활용:

연구에 따르면 소형 LLM 앙상블은 단일 모델 대비 OOS 감지 F1-score를 5% 이상 개선하고5, 텍스트 분류 정확도를 78% → 86%까지 끌어올린다6. 핵심은 불일치를 정보로 사용하는 것이다.

4.2 3단계 파이프라인

[Stage 1] 병렬 추론
  Gemma 4 E4B   →  label_A, confidence_A
  Qwen3.5-4B    →  label_B, confidence_B

[Stage 2] 동의/불일치 판정
  label_A == label_B
    → 확정 라벨 (신뢰도 평균 > 임계값 시)
  label_A != label_B
    → Stage 3으로 에스컬레이션

[Stage 3] 중재 또는 HITL
  confidence 차이 작음  →  Phi-4-mini 중재 추론
  confidence 차이 큼    →  HITL 큐 (사람 판정)

임계값 설정 기준:

  • 동의 + 고신뢰(>0.85): 자동 확정
  • 동의 + 저신뢰(<0.85): Phi-4-mini 검증
  • 불일치 + confidence 차이 < 0.2: Phi-4-mini 중재
  • 불일치 + confidence 차이 ≥ 0.2: HITL 에스컬레이션

4.3 Taxonomy A×O×C 분해와 불일치 패턴

Intent Taxonomy를 A(Action) × O(Object) × C(Context)로 분해하면, 불일치는 O 축에서 가장 자주 발생한다. "취소해줘"라는 발화에서 A(취소)는 두 모델이 동의하지만, O(무엇을 취소하나)에서 갈린다. 이 패턴이 감지되면 O 축 명시를 요구하는 HITL 질의를 생성할 수 있다.

불일치 분석:
  A축 동의 + O축 불일치  →  "Object 불명확" HITL 질의
  A축 불일치             →  "Action 불명확" 또는 OOS 검토
  전체 불일치            →  OOS 우선 검토

§5. 비용-성능 분석

5.1 배포 시나리오별 구성

시나리오구성예상 정확도비용
최소 비용Gemma 4 E4B × 3 (Majority Voting)단일 대비 +3-5%7최저 (동일 모델 3배)
권장E4B + Qwen3.5-4B + Phi-4-mini 중재경계 케이스 커버
HITL 통합E4B + Qwen3.5-4B → Disagreement → HITL최고 (사람 개입)중-고

5.2 하드웨어 요건

모델VRAM (Q4)병렬 구동
Gemma 4 E4B~4GB
Qwen3.5-4B~3GB
Phi-4-mini~3GB
합계 (동시 구동)~10GB단일 16GB GPU 가능

세 모델 모두 단일 16GB VRAM GPU에서 동시 구동 가능하다. 소비자용 RTX 4080 이상 또는 M3 Pro MacBook에서 로컬 완전 자립 구성이 된다.

5.3 Cascade 최적화

발화의 난이도 분포가 편향적일 때(쉬운 발화 >60%) Cascade가 효율적이다:

[1차] Gemma 4 E4B 단독
  confidence > 0.90  →  확정 (전체의 ~60% 처리)
  confidence ≤ 0.90  →  2차로 넘김

[2차] Qwen3.5-4B 추가 추론
  동의              →  확정
  불일치            →  Phi-4-mini 또는 HITL

FrugalGPT 방식의 cascade는 동등 품질에서 평균 추론 비용을 40-60% 절감한다8.


§6. 이론적 한계와 열린 질문

  1. PLE vs MoE 다양성: E4B의 PLE와 Qwen3.5-4B의 Gated DeltaNet이 실제로 다른 오류 패턴을 만드는지는 Intent Labeling 특화 벤치마크가 아직 없다. Disagreement Rate를 도메인 probe set으로 측정하는 사전 검증이 필요하다.

  2. Taxonomy 크기 의존성: Taxonomy가 소규모(< 50 intent)이면 단일 모델로도 충분할 수 있다. 앙상블 효과는 Taxonomy가 클수록, 계층이 깊을수록 두드러진다.

  3. Fine-tuning vs Ensemble 선택: E4B는 단일 GPU에서 LoRA fine-tuning이 가능하다. 도메인 데이터가 충분하다면 fine-tuning된 단일 모델이 앙상블보다 나을 수 있다. 두 전략은 경쟁이 아니라 조합 가능하다 — fine-tuned E4B + zero-shot Qwen3.5-4B 앙상블.

  4. 동일 발화 언어 편향: Qwen3.5-4B의 다국어 강점은 비영어 발화에서만 발현된다. 단일 언어 한국어 환경이라면 다국어 다양성의 이점이 줄어든다.


각주

Footnotes

  1. Google DeepMind (2026). Gemma 4: Byte for byte, the most capable open models. https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/

  2. 본 시리즈 v2 — 경량 LLM 앙상블: 다양성 기반 모델 조합 전략 (2026-04-17). 로컬 파일 참조.

  3. Alibaba Cloud Community (2026). Qwen3.5: Towards Native Multimodal Agents. https://www.alibabacloud.com/blog/qwen3-5-towards-native-multimodal-agents_602894

  4. Microsoft (2025). Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs. https://arxiv.org/html/2503.01743v1

  5. arXiv (2024). Intent Detection in the Age of LLMs. https://arxiv.org/html/2410.01627v1

  6. ScienceDirect (2025). Exploring Zero-Shot SLM ensembles as an alternative to LLMs for sentiment analysis. 검증 가능한 공개 출처 없음 (DOI 페이지 접근 제한).

  7. arXiv:2511.15714 (2025). Majority Rules: LLM Ensemble is a Winning Approach for Content Categorization. https://arxiv.org/abs/2511.15714

  8. Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. TMLR. https://arxiv.org/abs/2305.05176