中文

深度强化学习需要深度行为分析:探索无模型智能体在开放式环境中的隐式规划

人工智能 2025-12-02 v2 机器学习

摘要

理解深度强化学习(DRL)智能体的行为——尤其是随着任务和智能体复杂性的增加——需要的不仅仅是简单的奖励曲线比较,然而DRL中标准的行为分析方法仍不成熟。我们应用神经科学和行为学的工具,在一个新颖、复杂、部分可观测的环境ForageWorld中研究DRL智能体,该环境旨在捕捉现实世界动物觅食的关键方面——包括稀疏、可耗尽的资源斑块、捕食者威胁以及空间广阔的竞技场。我们利用这个环境作为平台,对智能体进行联合行为与神经分析,揭示了对智能体策略、记忆和规划的详细、定量化的洞察。与普遍假设相反,我们发现基于无模型RNN的DRL智能体可以纯粹通过涌现动力学表现出结构化的、类似规划的行为,而无需显式的记忆模块或世界模型。我们的结果表明,像研究动物一样研究DRL智能体——使用受神经行为学启发的工具分析其行为和神经动力学中的结构——能揭示其学习动力学中原本不可见的丰富结构。我们将这些工具提炼成一个通用分析框架,将核心行为和表征特征与诊断方法联系起来,该框架可复用于广泛的任务和智能体。随着智能体变得更加复杂和自主,连接神经科学、认知科学和人工智能将是必不可少的——不仅是为了理解它们的行为,更是为了确保安全对齐和最大化那些难以通过奖励衡量的期望行为。我们展示了如何通过借鉴研究生物智能的经验来实现这一点。

关键词

引用

@article{arxiv.2506.06981,
  title  = {Deep RL Needs Deep Behavior Analysis: Exploring Implicit Planning by Model-Free Agents in Open-Ended Environments},
  author = {Riley Simmons-Edler and Ryan P. Badman and Felix Baastad Berg and Raymond Chua and John J. Vastola and Joshua Lunger and William Qian and Kanaka Rajan},
  journal= {arXiv preprint arXiv:2506.06981},
  year   = {2025}
}

备注

Published at NeurIPS 2025