中文

无监督强化学习中的可解释学习动力学

机器学习 2025-05-13 v1 机器学习

摘要

我们提出了一种用于无监督强化学习 (URL) 智能体的可解释性框架,旨在理解内在动机如何塑造注意力、行为和表征学习。我们分析了五个智能体 DQN、RND、ICM、PPO 和一个 Transformer-RND 变体,这些智能体在程序生成环境中训练,使用 Grad-CAM、层次相关性传播 (LRP)、探索度量和潜在空间聚类进行分析。为捕捉智能体如何感知和随时间适应,我们引入了两个度量:注意力多样性度量了注意力的空间广度,注意力变化率量量了注意力的时间性转移。我们的发现表明,好奇心驱动的智能体比其外在动机驱动的对手在注意力和探索行为方面更广泛、更动态。其中,TransformerRND 结合了宽广的注意力、高探索覆盖率以及紧凑且有结构的潜在表征。我们的结果突显了架构归纳偏置和训练信号对内部智能体动态的影响。除了以奖励为中心的评估之外,本文提出的框架提供了探测感知和抽象能力的诊断工具,使智能体行为更具可解释性和可泛化性。

关键词

引用

@article{arxiv.2505.06279,
  title  = {Interpretable Learning Dynamics in Unsupervised Reinforcement Learning},
  author = {Shashwat Pandey},
  journal= {arXiv preprint arXiv:2505.06279},
  year   = {2025}
}