中文

通过将标记生成视为分类来突破LLM社区的性能天花板

计算与语言 2024-10-01 v2 人工智能

摘要

集成多个模型一直是推动现有性能极限的有效方法,在分类任务中通过简单地对来自多个分类器的分类概率向量进行平均即可实现更高的准确率。然而,在蓬勃发展的开源大语言模型(LLM)社区中,集成方法仍较少见,通常仅限于对LLM的完整文本输出进行集成,如通过排序器选择最佳输出,这导致未充分利用标记级别的概率信息。本文将LLM对每个标记的生成视为一种分类(GaC),用于集成。该方法充分利用每个生成步骤中的概率信息,更好地防止LLM生成早期错误的标记,从而导致误差的连锁反应。在实验中,我们在包含考试、数学和推理等多个基准测试上对状态最好的LLM进行集成,观察到我们的方法突破了社区现有的性能天花板。此外,我们观察到答案中的大多数标记都是简单的,不会影响最终答案的正确性。因此,我们还尝试仅对关键标记进行集成,结果在各个基准测试中表现更好且延迟更低。

关键词

引用

@article{arxiv.2406.12585,
  title  = {Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensembling},
  author = {Yao-Ching Yu and Chun-Chih Kuo and Ziqi Ye and Yu-Cheng Chang and Yueh-Se Li},
  journal= {arXiv preprint arXiv:2406.12585},
  year   = {2024}
}

备注

Accepted to EMNLP 2024