别总选表现最好的模型:LLM集成选择的信息论视角
机器学习
2026-02-10 v1 人工智能
分布式、并行与集群计算
信息论
math.IT
机器学习
摘要
大型语言模型(LLMs)常被集成以提高整体可靠性和鲁棒性,但实际中模型之间存在强相关性。这引出根本问题:在构建LLM集成时应选取哪些模型?我们将预算约束的集成选择建模为最大化真实标签与所选模型预测之间的互信息。进一步地,为解释为何性能即使拥有大量模型仍会饱和,我们使用高斯 copula 模型化所选模型的相关误差,并展示了集成性能的信息论误差下限。基于上述思考,我们提出一种简单的数据驱动的贪心互信息选择算法,直接从数据中估计所需信息量,并在查询预算约束下迭代构建集成。在两个问答数据集和一个二元情感分类数据集上进行测试:MEDMCQA、MMLU 和 IMDB 电影评论。我们在所有数据集上都观察到,该方法在相同查询预算下 consistently 优于强大的基线方法。
引用
@article{arxiv.2602.08003,
title = {Don't Always Pick the Highest-Performing Model: An Information Theoretic View of LLM Ensemble Selection},
author = {Yigit Turkmen and Baturalp Buyukates and Melih Bastopcu},
journal= {arXiv preprint arXiv:2602.08003},
year = {2026}
}