Field note · 2026-04
경량 LLM 앙상블 — 다양성 기반 모델 조합 전략
같은 모델을 여러 개 돌리는 건 앙상블이 아니라 낭비다. 오류 패턴이 다른 모델을 골라야 앙상블이 작동한다. 앙상블의 효과는 다양성(diversity)에서 온다. Ambiguity Decomposition Theorem이 이를 수학적으로 증명한다[^1]: 앙상블 오류 = 개별 모델 평균 오류 − 모델 간 다양성 다양성 항
경량 LLM 앙상블 — 다양성 기반 모델 조합 전략
같은 모델을 여러 개 돌리는 건 앙상블이 아니라 낭비다. 오류 패턴이 다른 모델을 골라야 앙상블이 작동한다.
§1. 문제 — 왜 "다른" 모델이어야 하는가
앙상블의 효과는 다양성(diversity)에서 온다. Ambiguity Decomposition Theorem이 이를 수학적으로 증명한다1:
앙상블 오류 = 개별 모델 평균 오류 − 모델 간 다양성
다양성 항이 클수록 앙상블 오류가 줄어든다. 같은 base에서 같은 방법으로 fine-tuning한 모델끼리 조합하면 오류 패턴이 겹치고, 다양성 항이 0에 수렴하여 앙상블 이점이 사라진다.
이는 경량 로컬 모델(7B-13B)에서 특히 중요하다. 개별 모델의 절대 성능이 낮을수록 다양성에 의한 보정 효과가 상대적으로 커지기 때문이다.
§2. 모델 분류 체계 — 4축 Taxonomy
앙상블 조합을 위한 분류 축은 문헌에서 4개로 수렴한다. LLMOrbit2이 50+ 모델을 8차원으로 분류했고, 이 중 앙상블 조합에 직접 관련되는 축을 추출하면 다음과 같다:
축 1: Architecture (아키텍처)
| 유형 | 특성 | 대표 모델 |
|---|---|---|
| Dense Transformer | 전체 파라미터 활성화 | LLaMA 3, Qwen, GPT-4 |
| Sparse MoE | 게이팅으로 일부 expert만 활성화 | Mixtral, DeepSeek-V3 (256 experts), Grok-1 |
| SSM (State Space Model) | O(L) 복잡도, 선형 시퀀스 처리 | Mamba, Mamba-2 |
| Hybrid | Transformer + SSM 결합 | Nemotron-H, Jamba |
아키텍처가 다르면 같은 입력에 대해 다른 내부 표현을 형성한다. CKA 유사도가 구조적으로 낮아진다3.
축 2: Training Methodology (학습 방법)
| 방법 | 특성 |
|---|---|
| Base (pretrain only) | 다음 토큰 예측만 학습 |
| SFT (Supervised Fine-Tuning) | 지시문-응답 쌍으로 미세조정 |
| DPO (Direct Preference Optimization) | 보상 모델 없이 선호도 직접 최적화 |
| RLHF (PPO) | 보상 모델 + 정책 최적화 |
| GRPO | Group Relative Policy Optimization (DeepSeek-R1) |
| ORPO | Odds Ratio Preference Optimization |
같은 base 모델이라도 DPO vs RLHF는 행동 분포가 다르다. Behavioral Fingerprinting 연구4에서 alignment 방법에 따른 행동 분기가 가장 극명하게 나타났다 — 핵심 역량(추론, 인과)은 수렴하지만, alignment 행동(sycophancy, semantic robustness)은 극단적으로 발산한다.
축 3: Capability Profile (능력 프로파일)
| 프로파일 | 특화 영역 | 대표 모델 |
|---|---|---|
| Reasoning | 수학, 논리, CoT | o1, o3, DeepSeek-R1 |
| Code | 코드 생성/분석 | DeepSeek-Coder, CodeLLaMA, Qwen-Coder |
| Creative/Dialogue | 대화, 창작 | Claude, GPT-4o |
| Multilingual | 다국어 | mT5, BLOOM, Qwen |
| Long-context | 장문 처리 | Gemini 1.5 Pro (1M), Claude 3 (200K) |
축 4: Size/Cost Tier (크기/비용 계층)
| 계층 | 파라미터 | 용도 |
|---|---|---|
| Micro | <3B | 엣지, 분류, 필터링 |
| Small | 7-13B | 로컬 앙상블 주력 |
| Medium | 30-70B | 로컬 aggregator 또는 cascade 상위 |
| Frontier | >70B | API cascade 최상위 |
핵심 원리: 4축에서 서로 다른 사분면에 위치한 모델끼리 조합하면 CKA 유사도가 낮고, 오류 비상관성(error decorrelation)이 높아 앙상블 효과가 극대화된다.
§3. 다양성 측정 — 어떤 모델이 "다른지" 어떻게 아는가
3.1 표현 유사도 지표
CKA (Centered Kernel Alignment)3: 두 모델의 hidden state 표현을 커널 공간에서 비교한다. Scale-invariant하고 직교 변환에 불변. 높은 CKA = 모델이 중복적(앙상블 불필요), 낮은 CKA = 상보적(앙상블 효과 높음).
RSA (Representational Similarity Analysis): 신경과학에서 유래. 모델 활성화를 Representational Dissimilarity Matrix로 변환하고 Spearman 상관으로 비교. 모델 패밀리 간 구별력이 CKA보다 높다5.
3.2 행동 다양성 지표
Focal Diversity (LLM-TOPLA)6: 오류 다양성(error diversity)과 다양성-성능 상관(diversity-performance correlation)을 동시에 측정하는 LLM 특화 지표. Genetic algorithm으로 최적 sub-ensemble을 100x 빠르게 탐색한다.
Disagreement Rate: 동일 probe set에 대한 출력 불일치율. 가장 실용적이며 모델 내부 접근이 불필요하다.
Behavioral Fingerprinting4: 진단 프롬프트 세트로 18개 차원의 레이더 차트를 생성. 모델 내부 접근 없이 capability profile 기반 비유사도를 추정한다.
EigenScore7: 문장 임베딩 공분산 행렬의 LogDet. 의미적 다양성의 proxy. 높은 EigenScore = 출력이 다양(모델 불확실) = hallucination 가능성 높음.
3.3 집계 품질 지표
Higher-Order Aggregation8: 단순 다수결(zero-order)은 모델 간 이질성과 상관을 무시한다. Optimal Weight(OW)와 Inverse Surprising Popularity(ISP)는 1차(기대 정확도)와 2차(답변 상관) 정보를 활용하여 집계 품질을 높인다.
§4. 앙상블 패러다임 — 5가지 조합 전략
| 패러다임 | 구조 | 비용 | 언제 쓰는가 |
|---|---|---|---|
| MoE (Mixture of Experts) | 단일 모델 내부, 게이팅으로 expert 선택 | 최저 (sparse) | 모델 설계 시점 |
| Ensemble | 독립 모델 전체 추론, 출력 집계 | 높음 (N배) | 품질 극대화 |
| Routing | 쿼리당 단일 모델 선택 | 낮음 (1배 + 라우터) | 비용 최적화 |
| Cascade | 저렴한 모델 먼저, 실패 시 상위 모델 | 중-저 | 난이도 분포가 편향적일 때 |
| MoA (Mixture-of-Agents) | 여러 모델이 제안, 하나가 종합 | 중-높 | 품질 + 다양성 동시 필요 |
4.1 Cascade (단계적 상승)
FrugalGPT9: 가장 저렴한 모델부터 시작, 신뢰도가 임계값 이하이면 상위 모델로 전달. GPT-4 동등 성능을 최대 98% 비용 절감으로 달성. 또는 동일 비용에서 +4% 정확도.
Hybrid LLM10: 비용-품질 최적 라우팅의 공식 프레임워크. 22% 쿼리만 LLaMA-2 13B에 할당하고도 GPT-4 대비 <1% 품질 저하.
Unified Routing & Cascading11: 순수 라우팅과 순수 cascade를 이론적으로 통합. "난이도 예측이 불확실하면 cascade, 확실하면 routing"이라는 최적 전략 도출.
4.2 Routing (쿼리별 모델 선택)
RouteLLM12: 인간 선호도 데이터(Chatbot Arena)로 라우터를 학습. MT-Bench에서 85%, MMLU에서 45% 비용 절감 (GPT-4 품질 95% 유지). 핵심 발견: GPT-4/Mixtral 쌍으로 학습한 라우터가 Claude 3/LLaMA 3에도 일반화 — 라우터는 모델이 아니라 쿼리 난이도를 학습한다.
Select-then-Route (StR)13: 2단계 — (1) task taxonomy로 모델 풀 사전 선택 (2) 풀 내에서 confidence cascade. 91.7% → 94.3% 정확도, 추론 비용 4x 절감.
IRT-Router14: 심리측정학의 Item Response Theory를 차용. 쿼리 난이도와 모델 능력을 잠재 변수로 모델링. 20개 LLM, 12개 데이터셋에서 검증. Cold-start 시 의미 유사도 기반 warm-up 지원.
BELLA15: Skill profile 기반 비용 최적화. Critic 기반 프로파일링으로 세밀한 skill을 추출 → 구조화된 capability matrix 생성 → 예산 제약 하 다목적 최적화. 자연어 추천 근거 제공.
RouterEval16: 2억+ 성능 기록, 8,500+ LLM, 12 task 도메인. 모델 수준 스케일링 법칙 발견 — 풀 크기가 커지고 라우터가 유능하면 최고 단일 모델을 초과하는 성능 달성 가능.
4.3 MoA (Mixture-of-Agents)
Mixture-of-Agents17: 여러 LLM이 "proposer"로 독립 응답 생성 → "aggregator" LLM이 종합. 핵심 현상: LLM collaborativeness — 약한 모델의 출력이라도 컨텍스트로 제공하면 강한 모델의 출력이 개선된다. 오픈소스만으로 AlpacaEval 2.0에서 65.1% 달성 (GPT-4o: 57.5%).
4.4 Model Merging (추론 비용 0 추가)
런타임 앙상블의 비용 문제를 우회하는 오프라인 대안18:
| 기법 | 방식 |
|---|---|
| Task Arithmetic | task vector를 weight space에서 가감산 |
| TIES-Merging | 작은 업데이트 제거, 부호 합의, 정렬된 파라미터만 병합 |
| DARE | 델타 파라미터 90-99% drop, 나머지 rescale |
| SLERP | 두 모델 간 구면 선형 보간 |
| Model Soup | 여러 체크포인트의 weight 평균 |
WARM19: 보상 모델에 weight averaging 적용. 단일 RM 대비 79.4% win rate. Distribution shift에 강건.
§5. 경량 로컬 앙상블 — 실전 설계 가이드
5.1 모델 선택 원칙
- 4축 분산: Architecture × Training × Capability × Size에서 겹치지 않게 선택
- Disagreement 측정: 도메인 대표 probe set(100-500건)으로 출력 불일치율 측정
- Focal Diversity 검증: LLM-TOPLA의 genetic algorithm으로 최적 sub-ensemble 탐색
5.2 조합 예시 (7B-13B 로컬)
[Proposer 1] Mistral-7B-Instruct (Dense, SFT, Dialogue)
[Proposer 2] DeepSeek-Coder-7B (Dense, SFT, Code)
[Proposer 3] Qwen2-7B (Dense, DPO, Multilingual)
[Aggregator] LLaMA-3-13B-Instruct (Dense, RLHF, General)
- 3개 proposer가 Architecture는 같지만 Training과 Capability에서 분산
- Aggregator는 상위 계층에서 종합
5.3 비용 최적화 전략
| 전략 | 적용 조건 | 기대 효과 |
|---|---|---|
| Cascade (7B → 13B) | 쿼리 난이도 분포가 편향적 (쉬운 쿼리 >60%) | 평균 비용 40-60% 절감 |
| MoA (7B×3 + 13B) | 품질이 최우선, 지연 시간 허용 | 최고 단일 모델 초과 성능 |
| Model Merging (7B×3 → 1) | 추론 비용 추가 불가, 오프라인 준비 가능 | 추론 비용 0 추가, 성능 개선 |
| Majority Voting (7B×5) | 분류/선택형 태스크 | 단일 모델 대비 +3-5% 정확도20 |
§6. 이론적 한계와 열린 질문
- 다양성-정확성 트레이드오프: 다양성이 높지만 개별 정확도가 너무 낮은 모델은 앙상블에 해가 된다. 최적 균형점은 태스크 의존적이다.
- 라우터의 일반화: RouteLLM이 모델 쌍 간 전이를 보였지만, 도메인 전이(의료→법률 등)는 미검증.
- Cold-start: 새로운 도메인에서 라우팅 데이터가 없을 때 — TRouter21가 계층적 task taxonomy + 합성 데이터로 이를 해결하려 시도.
- MoE vs Ensemble: 모델 내부 MoE(Mixtral 방식)와 모델 간 Ensemble의 상호작용은 아직 충분히 연구되지 않았다.
각주
Footnotes
-
Wood, D., Mu, T., Webb, A.M., Reeve, H.W.J., Luján, M., & Brown, G. (2023). A Unified Theory of Diversity in Ensemble Learning. JMLR, 24(359). https://jmlr.org/papers/v24/23-0041.html ↩
-
Patro, B.N. & Agneeswaran, V.S. (2026). LLMOrbit: A Circular Taxonomy of Large Language Models — From Scaling Walls to Agentic AI Systems. arXiv:2601.14053. https://arxiv.org/abs/2601.14053 ↩
-
Kornblith, S., Norouzi, M., Lee, H., & Hinton, G. (2019). Similarity of Neural Network Representations Revisited. ICML 2019. https://arxiv.org/abs/1905.00414 ↩ ↩2
-
Pei, Z. et al. (2025). Behavioral Fingerprinting of Large Language Models. arXiv:2509.04504. https://arxiv.org/abs/2509.04504 ↩ ↩2
-
ACM Computing Surveys (2025). Similarity of Neural Network Models: A Survey of Functional and Representational Measures. DOI:10.1145/3728458. https://dl.acm.org/doi/full/10.1145/3728458 ↩
-
Tekin, S.F., Ilhan, F., Huang, T., Hu, S., & Liu, L. (2024). LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity. Findings of EMNLP 2024. https://arxiv.org/abs/2410.03953 ↩
-
Chen, L. et al. (2024). INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection. ICLR 2024. https://arxiv.org/abs/2402.03744 ↩
-
Ai, R., Pan, Y., Simchi-Levi, D., Tambe, M., & Xu, H. (2025). Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information. arXiv:2510.01499. https://arxiv.org/abs/2510.01499 ↩
-
Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. TMLR. https://arxiv.org/abs/2305.05176 ↩
-
Ding, D. et al. (2024). Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing. ICLR 2024. https://arxiv.org/abs/2404.14618 ↩
-
Dekoninck, J., Baader, M., & Vechev, M. (2024). A Unified Approach to Routing and Cascading for LLMs. ICML 2025. https://arxiv.org/abs/2410.10347 ↩
-
Ong, I. et al. (2024). RouteLLM: Learning to Route LLMs from Preference Data. ICLR 2025. https://arxiv.org/abs/2406.18665 ↩
-
Shah, S. & Shridhar, K. (2025). Select-then-Route: Taxonomy Guided Routing for LLMs. EMNLP 2025 Industry Track. https://aclanthology.org/2025.emnlp-industry.28/ ↩
-
IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response Theory. ACL 2025. https://arxiv.org/abs/2506.01048 ↩
-
Okamoto, M., Erol, A.K., & Matlin, G. (2026). Trust by Design: Skill Profiles for Transparent, Cost-Aware LLM Routing. arXiv:2602.02386. https://arxiv.org/abs/2602.02386 ↩
-
Huang, Z. et al. (2025). RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs. Findings of EMNLP 2025. https://arxiv.org/abs/2503.10657 ↩
-
Wang, J. et al. (2024). Mixture-of-Agents Enhances Large Language Model Capabilities. arXiv:2406.04692. https://arxiv.org/abs/2406.04692 ↩
-
Yang, E. et al. (2026). Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities. ACM Computing Surveys. https://arxiv.org/abs/2408.07666 ↩
-
Ramé, A. et al. (2024). WARM: On the Benefits of Weight Averaged Reward Models. ICML 2024. https://arxiv.org/abs/2401.12187 ↩
-
arXiv:2511.15714 (2025). Majority Rules: LLM Ensemble is a Winning Approach for Content Categorization. https://arxiv.org/abs/2511.15714 ↩
-
arXiv:2604.09377 (2026). Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios. https://arxiv.org/abs/2604.09377 ↩