中文

DSANet:用于视频级表征学习的动态片段聚合网络

计算机视觉与模式识别 2021-08-18 v3 多媒体

摘要

长程与短程时间建模是视频识别中两个互补且至关重要的方面。大多数现有最优方法侧重于短程时空建模,然后对多个片段级预测取平均以得到最终视频级预测。因此,它们的视频级预测未考虑视频沿时间维度演化的时空特征。本文中,我们提出一种新颖的动态片段聚合(DSA)模块来捕获片段间关系。具体而言,我们尝试为卷积操作生成动态核,以自适应地聚合相邻片段间的长程时间信息。DSA模块是一种高效的即插即用模块,可与现成的基于片段的模型(即TSM、I3D)结合,以极小开销实现强大的长程建模。最终的视频架构被称为DSANet。我们在多个视频识别基准(即Mini-Kinetics-200、Kinetics-400、Something-Something V1和ActivityNet)上进行了大量实验以展示其优越性。我们提出的DSA模块被证明可显著受益于各类视频识别模型。例如,配备DSA模块后,I3D ResNet-50在Kinetics-400上的top-1准确率从74.9%提升至78.2%。代码见https://github.com/whwu95/DSANet。

关键词

引用

@article{arxiv.2105.12085,
  title  = {DSANet: Dynamic Segment Aggregation Network for Video-Level Representation Learning},
  author = {Wenhao Wu and Yuxiang Zhao and Yanwu Xu and Xiao Tan and Dongliang He and Zhikang Zou and Jin Ye and Yingying Li and Mingde Yao and Zichao Dong and Yifeng Shi},
  journal= {arXiv preprint arXiv:2105.12085},
  year   = {2021}
}

备注

Accepted to ACMMM2021