中文

思维迭代:利用内心对话实现大语言模型的自主推理

计算与语言 2024-10-02 v2 人工智能 机器学习 多智能体系统

摘要

迭代式的人类参与是利用大语言模型(LLMs)强大语言处理能力的一种常见且有效的方式。通过以对话方式使用结构良好的提示,人类用户可以有效地引导LLM生成更深入、更准确的响应。受此启发,我们提出了思维迭代(IoT)框架,通过针对输入查询和LLM当前迭代响应生成“激发思考”的提示来增强LLM的响应。与静态或半静态方法(如思维链(CoT)或思维树(ToT))不同,IoT根据不断变化的上下文动态调整其推理路径,且不生成最终被丢弃的替代性探索思维。IoT框架的三个组成部分是:(1)内部对话代理(IDA),负责生成有指导性的、上下文特定的提示;(2)LLM代理(LLMA),处理这些提示以优化其响应;(3)迭代提示循环,实现前两个组件之间的对话。我们引入了该框架的两种变体:自主思维迭代(AIoT),由LLM决定何时停止迭代;以及引导式思维迭代(GIoT),始终强制进行固定次数的迭代。我们在多个数据集上研究了IoT的性能,涵盖来自GPQA数据集的复杂推理任务、Game of 24中的探索性问题求解、Mini Crosswords中的谜题求解以及来自HotpotQA数据集的多跳问答。我们的结果表明,IoT代表了LLM响应自主优化的一种有效范式,相较于CoT有显著改进,从而实现了更少人工干预、更具适应性和效率的推理系统。

关键词

引用

@article{arxiv.2409.12618,
  title  = {Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning},
  author = {Santosh Kumar Radha and Yasamin Nouri Jelyani and Ara Ghukasyan and Oktay Goktas},
  journal= {arXiv preprint arXiv:2409.12618},
  year   = {2024}
}