中文

ProtoX:通过原型化解释强化学习智能体

机器学习 2022-11-08 v1 计算机视觉与模式识别

摘要

尽管深度强化学习在解决控制任务方面已被证明是成功的,但智能体的“黑盒”性质日益引发关注。我们提出了一种基于原型的后验策略解释器 ProtoX,它通过将智能体的行为原型化为若干场景来解释黑盒智能体,每个场景由一个原型状态表示。在学习原型时,ProtoX 同时考虑视觉相似性与场景相似性。后者是强化学习情境所独有的,因为它解释了为何在视觉不同的状态下会采取相同动作。为让 ProtoX 学习视觉相似性,我们通过自监督学习中的对比学习预训练一个编码器,以识别若状态在时间上接近且被黑盒智能体施加相同动作则为相似状态。随后我们添加一个等距层,使 ProtoX 能令场景相似性适应下游任务。ProtoX 通过行为克隆的模仿学习进行训练,因此无需访问环境或智能体。除解释保真度外,我们在目标函数中设计了不同的原型塑造项以鼓励更好的可解释性。我们进行了多种实验来测试 ProtoX。结果表明,ProtoX 在对原始黑盒智能体保持高保真度的同时,提供了有意义且可理解的解释。

关键词

引用

@article{arxiv.2211.03162,
  title  = {ProtoX: Explaining a Reinforcement Learning Agent via Prototyping},
  author = {Ronilo J. Ragodos and Tong Wang and Qihang Lin and Xun Zhou},
  journal= {arXiv preprint arXiv:2211.03162},
  year   = {2022}
}