用于可视化解释视频理解模型的梯度频率调制
计算机视觉与模式识别
2021-12-01 v2
摘要
在许多应用中,理解机器学习模型为何做出其决策至关重要,但这受到最先进神经网络的黑盒性质所阻碍。因此,深度学习的可解释性日益受到关注,包括视频理解领域。由于视频数据的时间维度,解释视频动作识别模型的主要挑战在于产生时空一致的视觉解释,而现有文献忽略了这一点。本文提出基于频率的极值扰动(F-EP)来解释视频理解模型的决策。由于扰动方法给出的解释在空间和时间上均存在噪声且不平滑,我们提出利用离散余弦变换(DCT)对神经网络模型的梯度图频率进行调制。我们在一系列实验中表明,与现有最先进方法相比,F-EP提供了更具时空一致性、且更忠实反映模型决策的解释。
引用
@article{arxiv.2111.01215,
title = {Gradient Frequency Modulation for Visually Explaining Video Understanding Models},
author = {Xinmiao Lin and Wentao Bao and Matthew Wright and Yu Kong},
journal= {arXiv preprint arXiv:2111.01215},
year = {2021}
}
备注
Accepted by BMVC 2021