深入探究深度时空网络编码了什么:静态与动态信息的量化
计算机视觉与模式识别
2022-06-08 v1
摘要
深度时空模型被用于各种计算机视觉任务,如动作识别和视频对象分割。目前,人们对这些模型在其中间表示中捕获了哪些信息的理解仍然有限。例如,虽然已观察到动作识别算法深受单帧静态视觉外观的影响,但尚无定量方法来评估潜在表示中此类静态偏差相对于动态信息(如运动)偏差的程度。我们应对这一挑战,提出了一种量化任意时空模型静态与动态偏差的新方法。为展示我们方法的有效性,我们分析了两个被广泛研究的任务:动作识别和视频对象分割。我们的关键发现有三方面:(i)大多数被考察的时空模型偏向于静态信息;尽管某些具有交叉连接的双流架构在所捕获的静态与动态信息之间表现出更好的平衡。(ii)一些通常被认为偏向动态的数据库实际上偏向于静态信息。(iii)架构中的单个单元(通道)可能偏向于静态、动态或二者兼而有之。
引用
@article{arxiv.2206.02846,
title = {A Deeper Dive Into What Deep Spatiotemporal Networks Encode: Quantifying Static vs. Dynamic Information},
author = {Matthew Kowal and Mennatullah Siam and Md Amirul Islam and Neil D. B. Bruce and Richard P. Wildes and Konstantinos G. Derpanis},
journal= {arXiv preprint arXiv:2206.02846},
year = {2022}
}
备注
CVPR 2022