中文

基于选择性输入梯度正则化策略蒸馏的高效可解释性方法

机器学习 2022-05-19 v1 人工智能

摘要

尽管深度强化学习(RL)在广泛任务中已被证明成功,其面临的一个挑战是应用于真实世界问题时的可解释性。显著图常被用于为深度神经网络提供可解释性。然而,在 RL 领域,现有的显著图方法要么计算昂贵从而无法满足真实场景的实时需求,要么无法为 RL 策略生成可解释的显著图。在本工作中,我们提出一种选择性输入梯度正则化蒸馏(DIGR)方法,该方法利用策略蒸馏与输入梯度正则化来产生新的策略,在生成显著图时同时实现高可解释性与计算效率。我们的方法还被发现能提升 RL 策略对多种对抗攻击的鲁棒性。我们在三个任务上进行了实验:MiniGrid(Fetch Object)、Atari(Breakout)与 CARLA 自动驾驶,以展示我们方法的重要性和有效性。

关键词

引用

@article{arxiv.2205.08685,
  title  = {Policy Distillation with Selective Input Gradient Regularization for Efficient Interpretability},
  author = {Jinwei Xing and Takashi Nagata and Xinyun Zou and Emre Neftci and Jeffrey L. Krichmar},
  journal= {arXiv preprint arXiv:2205.08685},
  year   = {2022}
}