循环、注意力还是卷积?时序建模是否影响动作识别中的跨域鲁棒性
计算机视觉与模式识别
2022-10-12 v4
摘要
当今大多数动作识别模型参数规模庞大,并在具有外观上可区分类别的数据集上评估。研究还表明,在静态图像识别任务中,2D 卷积神经网络(CNN)往往偏向于纹理而非形状,这与人类相反。综合来看,这令人怀疑大型视频模型部分地学习到了虚假的空间纹理关联,而非随时间追踪相关形状以从其运动中推断可泛化的语义。在学习随时间变化的视觉模式时避免参数爆炸的一个自然方法是利用循环。生物视觉包含丰富的循环回路,并且在域偏移泛化方面优于计算机视觉。在本文中,我们从经验上研究底层时序建模的选择是否对纹理偏置与跨域鲁棒性有影响。为了能够轻量且系统地评估捕捉单帧未揭示的时序结构的能力,我们提供了 Temporal Shape(TS)数据集,以及 Diving48 的修改域,以便研究视频模型中的空间纹理偏置。我们实验的综合结果表明,当任务对域偏移的鲁棒性十分重要时,时序建模中诸如循环这样的合理物理归纳偏置可能是有利的。
引用
@article{arxiv.2112.12175,
title = {Recur, Attend or Convolve? On Whether Temporal Modeling Matters for Cross-Domain Robustness in Action Recognition},
author = {Sofia Broomé and Ernest Pokropek and Boyu Li and Hedvig Kjellström},
journal= {arXiv preprint arXiv:2112.12175},
year = {2022}
}