中文

何时集合:识别大语言模型集合的标记级点

计算与语言 2026-03-16 v2 人工智能

摘要

对大语言模型(LLMs)进行集合处理引起了广泛关注,作为超越单个模型性能的有前景方法,利用其互补优势。特别是,对模型的下一个标记概率分布进行聚合以选择下一个标记,在各种任务中已被证明有效。然而,尽管在短形式答案方面取得了成功,但其在长形式生成中的应用仍未得到充分探索。本文表明,使用现有集合方法进行长形式生成需要仔细选择集合位置,因为在每个标记处进行集合的常规做法会降低性能。我们识别了确定集合位置的两个关键因素:跨模型的标记化不匹配以及它们在下一个标记概率分布方面的共识。基于此,我们提出了 SAFE(Stable And Fast LLM Ensembling)框架,通过联合考虑这两个因素来选择性地进行集合。为进一步提升稳定性,我们应用概率锐化策略,当集合分布过于平滑时,可在集合过程中选择更自信的标记。我们在包括 MATH500 和 BBH 在内的多样化基准数据集上的实验表明,SAFE 在准确率和效率方面均优于现有方法,即使只对少于 1% 标记进行集合,也能够实现提升。

关键词

引用

@article{arxiv.2510.15346,
  title  = {When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling},
  author = {Heecheol Yun and Kwangmin Ki and Junghyun Lee and Eunho Yang},
  journal= {arXiv preprint arXiv:2510.15346},
  year   = {2026}
}

备注

ICLR 2026