中文

解读模型无关强化学习中的涌现规划行为

机器学习 2025-04-03 v1 人工智能

摘要

我们首次提供了模型无关强化学习代理能学习规划的机制性证据。这通过对 Sokoban 中的一个模型无关代理应用基于概念的可解释性方法实现——Sokoban 是研究规划常用基准。具体而言,我们展示了 DRC(由 Guez 等人 2019 年提出的通用模型无关代理)使用所学习的概念表示来内部形式化计划,这些计划既预测动作对环境的长期影响,又影响动作选择。我们的方法包括:(1)探测规划相关概念,(2)研究代理表示中的计划形成,(3)验证所发现的计划(在代理表示中)通过干预对代理行为产生因果影响。我们还展示,这些计划的涌现与一种规划样属性的涌现同步,即:从额外的测试时计算中受益的能力。最后,我们对代理所学习的规划算法进行定性分析,发现其与并行双向搜索高度相似。我们的发现促进了对代理内部机制中规划行为的理解,这正是近年来涌现式规划和推理能力在大语言模型中通过 RL 趋势的重要因素。

关键词

引用

@article{arxiv.2504.01871,
  title  = {Interpreting Emergent Planning in Model-Free Reinforcement Learning},
  author = {Thomas Bush and Stephen Chung and Usman Anwar and Adrià Garriga-Alonso and David Krueger},
  journal= {arXiv preprint arXiv:2504.01871},
  year   = {2025}
}

备注

ICLR 2025 oral