中文

思考大语言模型:通用指令遵循的思维生成

计算与语言 2024-10-15 v1 人工智能

摘要

大语言模型通常被训练来回答用户问题或遵循指令,方式类似于人类专家的响应方式。然而,在标准的对齐框架中,它们缺乏在作答前进行显式思考的基本能力。思考对于需要推理和规划的复杂问题至关重要——但可被应用于任何任务。我们提出一种训练方法,为现有的大语言模型赋予通用指令遵循的思维能力,而无需额外的人类数据。我们通过迭代搜索和优化程序实现这一目标,通过探索可能的思维生成空间,使模型能够在没有直接监督的情况下学习如何思考。对于每条指令,思考候选方案会使用评判模型对其响应进行评分,然后通过偏好优化进行优化。我们展示,这一程序在 AlpacaEval 和 Arena-Hard 上的表现优异,在营销、健康和常识等非推理类别以及更传统的推理与问题解决任务方面均显示出思考带来的提升。

关键词

引用

@article{arxiv.2410.10630,
  title  = {Thinking LLMs: General Instruction Following with Thought Generation},
  author = {Tianhao Wu and Janice Lan and Weizhe Yuan and Jiantao Jiao and Jason Weston and Sainbayar Sukhbaatar},
  journal= {arXiv preprint arXiv:2410.10630},
  year   = {2024}
}