中文

在强化学习中利用奖励一致性进行可解释特征发现

机器学习 2023-09-06 v1

摘要

深度强化学习(RL)的黑盒特性阻碍了其现实应用。因此,解释与说明RL智能体近年成为活跃的研究课题。现有的事后解释方法通常采用动作匹配原则,以便轻松理解基于视觉的RL智能体。本文认为,常用的动作匹配原则更像是深度神经网络(DNNs)的解释而非RL智能体的解释。当不同DNN输出导致相同奖励,或相同输出引发不同奖励时,它可能导致无关或错位的特征归因。因此,我们提出将奖励——RL智能体的根本目标——同样作为解释RL智能体的根本目标。为确保可解释特征发现中的奖励一致性,我们提出一个新框架(RL解释RL,记为RL-in-RL)以解决从动作到奖励的梯度断开问题。我们在Atari 2600游戏及Duckietown这一具挑战性的自动驾驶模拟环境中验证并评估了我们的方法。结果显示,我们的方法能够保持奖励(或回报)一致性并实现高质量特征归因。进一步,一系列分析实验验证了我们对动作匹配原则局限性的假设。

关键词

引用

@article{arxiv.2309.01458,
  title  = {Leveraging Reward Consistency for Interpretable Feature Discovery in Reinforcement Learning},
  author = {Qisen Yang and Huanqian Wang and Mukun Tong and Wenjie Shi and Gao Huang and Shiji Song},
  journal= {arXiv preprint arXiv:2309.01458},
  year   = {2023}
}