中文

LLMs 通过聚合自身响应可以生成更好的答案

计算与语言 2025-04-15 v2

摘要

大型语言模型(LLMs)在各项任务中展现了显著的能力,但面对复杂问题时通常需要额外的提示技术。虽然像自我纠错和响应选择等方法已成为流行的解决方案,但最近的研究表明,当依赖LLM本身来提供反馈或选择标准时,这些方法表现不佳。我们认为这一局限性源于常见的LLM后训练程序缺乏对判别判断任务的显式监督。在本文中,我们提出了生成式自聚合(Generative Self-Aggregation, GSA),这是一种无需模型判别能力即可提升答案质量的新提示方法。GSA首先从LLM中采样多个多样化响应,然后将它们聚合以获得改进的解。与先前方法不同,我们的方法不需要LLM纠正错误或比较响应质量;相反,它利用模型的生成能力基于多个样本的上下文综合新的响应。虽然GSA与用于响应聚合的自一致性(SC)方法有相似之处,但SC需要特定的可验证标记来实现多数投票。相比之下,我们的方法更通用,可以应用于开放性任务。实证评估表明,GSA在数学推理、知识性问题以及开放性生成任务(如代码合成和对话响应)等各类任务中有效提升了响应质量。

关键词

引用

@article{arxiv.2503.04104,
  title  = {LLMs Can Generate a Better Answer by Aggregating Their Own Responses},
  author = {Zichong Li and Xinyu Feng and Yuheng Cai and Zixuan Zhang and Tianyi Liu and Chen Liang and Weizhu Chen and Haoyu Wang and Tuo Zhao},
  journal= {arXiv preprint arXiv:2503.04104},
  year   = {2025}
}