利用一致性实现稳健的测试时LLM集成
计算与语言
2026-01-21 v2 人工智能
摘要
不同的大语言模型(LLM)具有各自的优势与不足,LLM集成作为一种整合其互补能力的有前景的方法。尽管在提升集成质量方面取得了显著进展,但对集成对潜在错误信号鲁健性的关注仍不足,这些错误信号常源于异构的分词方案和模型专业知识的差异。我们的分析表明,集成失效通常源于词汇级别和模型级别:前者反映词汇预测之间的严重不一致,后者涉及低置信度和模型间显著差异。基于此,我们提出CoRE,一种可即插即用的技术,通过利用模型一致性实现稳健的LLM集成,可无缝集成到各种集成方法中。*词汇级别一致性*通过对不确定的词汇预测应用低通滤波以降低不一致性(常因词汇对齐不一致导致),从而在粒度层面提升鲁健性。*模型级别一致性*通过促进高自信且与其他模型最小差异的模型输出,实现在更粗粒度层面的鲁健性提升。广泛的实验覆盖多样化的基准、模型组合和集成策略,均表明CoRE始终能提升集成性能和鲁健性。我们的代码已发布于https://github.com/zhichenz98/CoRE-EACL26。
引用
@article{arxiv.2510.13855,
title = {Harnessing Consistency for Robust Test-Time LLM Ensemble},
author = {Zhichen Zeng and Qi Yu and Xiao Lin and Ruizhong Qiu and Xuying Ning and Tianxin Wei and Yuchen Yan and Jingrui He and Hanghang Tong},
journal= {arXiv preprint arXiv:2510.13855},
year = {2026}
}
备注
18 pages, 15 figures