中文

大语言模型能够实现策略迭代

机器学习 2023-08-15 v2

摘要

本工作提出了上下文策略迭代(In-Context Policy Iteration, ICPI),一种利用基础模型在上下文中执行强化学习(RL)的算法。尽管基础模型在RL中的应用已受到相当关注,多数方法依赖于(1)专家演示的整理(通过手动设计或任务特定预训练)或(2)使用梯度方法(微调或适配器层训练)对感兴趣任务的适配。这两种技术均有缺陷。收集演示耗费人力,且依赖演示的算法表现不会超过派生出演示的专家。所有梯度技术本质上都缓慢,牺牲了使上下文学习起初具有吸引力的“少样本”特性。在本工作中,我们提出一种无需专家演示或梯度的ICPI算法。我们转而提出一种策略迭代方法,其中提示内容是整个学习的场所。ICPI通过与环境试错交互,迭代更新提示内容,并从中导出其策略。为消除上下文权重学习(如Decision Transformer所严重依赖的)的作用,我们使用Codex(一个对我们评估领域无先验知识的语言模型)来演示我们的算法。

关键词

引用

@article{arxiv.2210.03821,
  title  = {Large Language Models can Implement Policy Iteration},
  author = {Ethan Brooks and Logan Walls and Richard L. Lewis and Satinder Singh},
  journal= {arXiv preprint arXiv:2210.03821},
  year   = {2023}
}

备注

10 pages, 4 figures, submitted to ICLR 2023