中文

用于可视化解释视频理解模型的梯度频率调制

计算机视觉与模式识别 2021-12-01 v2

摘要

在许多应用中,理解机器学习模型为何做出其决策至关重要,但这受到最先进神经网络的黑盒性质所阻碍。因此,深度学习的可解释性日益受到关注,包括视频理解领域。由于视频数据的时间维度,解释视频动作识别模型的主要挑战在于产生时空一致的视觉解释,而现有文献忽略了这一点。本文提出基于频率的极值扰动(F-EP)来解释视频理解模型的决策。由于扰动方法给出的解释在空间和时间上均存在噪声且不平滑,我们提出利用离散余弦变换(DCT)对神经网络模型的梯度图频率进行调制。我们在一系列实验中表明,与现有最先进方法相比,F-EP提供了更具时空一致性、且更忠实反映模型决策的解释。

关键词

引用

@article{arxiv.2111.01215,
  title  = {Gradient Frequency Modulation for Visually Explaining Video Understanding Models},
  author = {Xinmiao Lin and Wentao Bao and Matthew Wright and Yu Kong},
  journal= {arXiv preprint arXiv:2111.01215},
  year   = {2021}
}

备注

Accepted by BMVC 2021