面向视频识别任务的可解释深度学习:框架与建议
机器学习
2019-09-13 v1 计算机视觉与模式识别
人机交互
图像与视频处理
机器学习
摘要
深度学习在现实应用中的普及度持续增长。随着高性能硬件的引入,应用不再局限于图像识别。更复杂问题的引入带来了愈发复杂的解决方案,以及对可解释 AI 日益增长的需求。用于视频任务的深度神经网络属于最复杂的模型之列,其参数至少为图像对应模型的两倍。然而,针对这些模型的解释往往不适应视频领域。当前视频模型可解释性的工作仍被图像技术所掩盖,而视频深度学习本身正迅速赶上静态图像的方法。本文旨在通过首先阐明视频深度学习的前沿,继而指出针对这些方法的解释研究之匮乏,来凸显为视频深度学习模型及相应的时空输入所设计的可解释性方法的必要性。
引用
@article{arxiv.1909.05667,
title = {Explainable Deep Learning for Video Recognition Tasks: A Framework & Recommendations},
author = {Liam Hiley and Alun Preece and Yulia Hicks},
journal= {arXiv preprint arXiv:1909.05667},
year = {2019}
}