中文

为未来推理、为当下行动:一种具有可证样本效率的自主LLM智能体原则性框架

人工智能 2024-07-02 v3 机器学习

摘要

大语言模型(LLMs)展现出令人印象深刻的推理能力,但将推理转化为现实世界中的行动仍具挑战性。特别是,如何通过最少次数的与外部环境的交互(例如通过内部推理机制)可证明地完成给定任务,尚不清楚。为此,我们提出了一种具有可证后悔保证来编排推理与行动的原则性框架,称之为“为未来推理、为当下行动”(\texttt{RAFA})。具体而言,我们设计了一个从记忆缓冲区学习并规划长期视野上未来轨迹的推理提示模板(“为未来推理”)。在每一步,LLM智能体执行所规划轨迹的初始动作(“为当下行动”),将收集到的反馈存入记忆缓冲区,并重新调用推理例程从新状态重新规划未来轨迹。其核心思想是将LLM中的推理视为贝叶斯自适应马尔可夫决策过程(MDPs)中的学习与规划。相应地,我们提示LLM从记忆缓冲区形成对未知环境的更新后验(学习),并生成最大化价值函数的多步未来最优轨迹(规划)。学习与规划子例程以“上下文内”方式执行,以模拟MDP的actor-critic更新。我们的理论分析证明,这种长期推理与短期行动的新颖结合实现了T\sqrt{T}后悔。此处,TT表示在线交互次数。特别地,后悔界凸显了通过预训练获得的先验知识与通过推理和行动实现的不确定性削减之间引人入胜的相互作用。我们的实证验证表明,它优于多种现有框架,并在若干基准上取得近乎完美的分数。

关键词

引用

@article{arxiv.2309.17382,
  title  = {Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency},
  author = {Zhihan Liu and Hao Hu and Shenao Zhang and Hongyi Guo and Shuqi Ke and Boyi Liu and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2309.17382},
  year   = {2024}
}

备注

Accepted by International Conference on Machine Learning (ICML) 2024