深度时空网络中静态与动态信息的量化及学习
计算机视觉与模式识别
2024-09-17 v2
摘要
对于深度时空模型在其中间表示中所捕捉的信息,目前的理解十分有限。例如,尽管有证据表明动作识别算法深受单帧视觉外观的影响,但尚不存在量化此类潜在表示中静态偏置相对于动态偏置的定量方法。我们应对这一挑战,提出一种量化任意时空模型静态与动态偏置的方法,并将该方法应用于三项任务:动作识别、自动视频对象分割(AVOS)和视频实例分割(VIS)。我们的关键发现是:(i)大多数受检模型偏向于静态信息;(ii)一些被认为偏向动态的数据库实际上偏向静态信息;(iii)架构中的单个通道可偏向静态、动态或二者结合;(iv)大多数模型在训练前半段即收敛至其最终偏置。我们随后探究了这些偏置如何影响在动态偏置数据集上的性能。对于动作识别,我们提出 StaticDropout,一种将模型从静态信息去偏至动态的语义引导 dropout。对于 AVOS,我们相比以往架构设计了更优的融合与跨连接层组合。
引用
@article{arxiv.2211.01783,
title = {Quantifying and Learning Static vs. Dynamic Information in Deep Spatiotemporal Networks},
author = {Matthew Kowal and Mennatullah Siam and Md Amirul Islam and Neil D. B. Bruce and Richard P. Wildes and Konstantinos G. Derpanis},
journal= {arXiv preprint arXiv:2211.01783},
year = {2024}
}
备注
TPAMI 2024. arXiv admin note: substantial text overlap with arXiv:2206.02846