中文

通过想象、搜索与批判实现大语言模型的自我改进

计算与语言 2024-12-11 v2 机器学习

摘要

尽管大语言模型(LLM)在各种任务上表现出令人印象深刻的能力,但它们仍然在涉及复杂推理和规划的场景中挣扎。最近的工作提出了先进的提示技术以及使用高质量数据进行微调的必要性,以增强LLM的推理能力。然而,这些方法本质上受到数据可用性和质量的限制。鉴于此,自我修正和自我学习成为可行的解决方案,采用允许LLM改进其输出并从自我评估的奖励中学习的策略。然而,LLM在自我完善其响应方面的有效性,特别是在复杂推理和规划任务中,仍然值得怀疑。在本文中,我们介绍了AlphaLLM用于LLM的自我改进,它将蒙特卡洛树搜索(MCTS)与LLM相结合,建立了一个自我改进循环,从而在没有额外标注的情况下增强LLM的能力。受AlphaGo成功的启发,AlphaLLM解决了将MCTS与LLM结合用于自我改进的独特挑战,包括数据稀缺、语言任务搜索空间的巨大性以及语言任务中反馈的主观性。AlphaLLM由提示合成组件、一种针对语言任务量身定制的高效MCTS方法以及一组用于精确反馈的三个批评模型组成。我们在数学推理任务上的实验结果表明,AlphaLLM在没有额外标注的情况下显著提升了LLM的性能,展示了LLM自我改进的潜力。

关键词

引用

@article{arxiv.2404.12253,
  title  = {Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing},
  author = {Ye Tian and Baolin Peng and Linfeng Song and Lifeng Jin and Dian Yu and Haitao Mi and Dong Yu},
  journal= {arXiv preprint arXiv:2404.12253},
  year   = {2024}
}

备注

NeurIPS 2024