从语言到行动:揭示LLM驱动的自主系统的理论基础
机器学习
2024-07-23 v2 人工智能
计算与语言
摘要
在这项工作中,我们从理论角度出发,旨在理解为什么大型语言模型(LLM)赋能的智能体能够解决物理世界中的决策问题。为此,考虑一个分层强化学习(RL)模型,其中LLM规划器和执行器分别执行高层任务规划和低层执行。在该模型下,LLM规划器通过提示迭代生成基于语言的子目标,从而导航一个部分可观测马尔可夫决策过程(POMDP)。在关于预训练数据的适当假设下,我们证明了预训练的LLM规划器通过上下文学习有效地执行了贝叶斯聚合模仿学习(BAIL)。此外,我们通过证明朴素地执行LLM返回的子目标会导致线性遗憾,强调了在BAIL派生的子目标之外进行探索的必要性。作为补救措施,我们向BAIL引入了一种-贪心探索策略,并证明当预训练误差较小时,该策略会产生次线性遗憾。最后,我们将理论框架扩展到LLM规划器作为推断环境转移模型的世界模型的场景,以及多智能体设置,从而实现多个执行器之间的协调。
引用
@article{arxiv.2405.19883,
title = {From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems},
author = {Jianliang He and Siyu Chen and Fengzhuo Zhang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2405.19883},
year = {2024}
}
备注
47 pages, accepted by ICML 2024