中文

LLM 应像人类一样思考与行动

计算与语言 2025-02-24 v2 人工智能

摘要

近来训练大语言模型用作聊天助手非常流行,但在用户与聊天助手的对话中,存在需要聊天助手与用户之间进行多轮交互的提示。然而,多轮对话存在诸多问题:聊天助手的回复容易出错,无法帮助用户实现目标,且随着对话轮数增加,出错的概率也会增加;聊天助手难以根据同一提示的实际需求生成具有不同过程的回复;聊天助手需要使用工具,但当前的方式不够优雅高效,且工具调用次数受限。这些问题的主要原因是,大语言模型不具备人类的思维能力,缺乏推理能力和规划能力,以及执行计划的能力。为解决这些问题,我们提出了一种基于内置思维链的思考方法:在多轮对话中,针对每个用户提示,大语言模型基于聊天历史、思考上下文、动作调用、记忆和知识等元素进行思考,进行详细的推理和规划,并根据计划执行动作。我们还探讨了大语言模型如何通过该思考方法增强思维能力:根据该思考方法收集训练数据集,并通过有监督学习微调大语言模型;训练一致性奖励模型并将其作为奖励函数,使用强化学习微调大语言模型,使强化后的大语言模型按照这种思维方式输出。我们的实验结果表明,大语言模型的推理能力和规划能力得到增强,多轮对话中的问题得到解决。

关键词

引用

@article{arxiv.2502.13475,
  title  = {LLM should think and action as a human},
  author = {Haun Leung and ZiNan Wang},
  journal= {arXiv preprint arXiv:2502.13475},
  year   = {2025}
}

备注

12 pages, 4 figures, 1 table