中文

面向视觉深度强化学习的可解释特征提取器:关注何处以及何物

人工智能 2025-04-15 v1

摘要

当前的可解释深度强化学习方法在注意力掩码与视觉输入中存在位移问题。本工作针对传统卷积神经网络 (CNN) 中的空间问题进行了探讨。我们提出了可解释特征提取器 (IFE) 架构,旨在生成准确的注意力掩码,以说明智能体在空间领域关注的"什么"和"哪里"。我们的设计包含人类可理解编码模块用于生成完全可解释的注意力掩码,随后是智能体友好编码模块用于提高智能体的学习效率。这两个组件共同构成了面向视觉深度强化学习的可解释特征提取器,以实现模型的可解释性。得到的注意力掩码具有一致性、高度人类可理解性、准确的空间维度,并有效地突出显示视觉输入中重要对象或位置。将可解释特征提取器集成到快速且数据高效的Rainbow框架中,并在57个ATARI游戏上进行评估,以展示该方法在空间保持性、可解释性和数据效率方面的有效性。最后,我们通过将IFE集成到异步优势演员-评论家模型中来展示该方法的通用性。

关键词

引用

@article{arxiv.2504.10071,
  title  = {Pay Attention to What and Where? Interpretable Feature Extractor in Vision-based Deep Reinforcement Learning},
  author = {Tien Pham and Angelo Cangelosi},
  journal= {arXiv preprint arXiv:2504.10071},
  year   = {2025}
}