面向未修剪视频分析的时序概念感受野动态建模
计算机视觉与模式识别
2021-11-24 v1
摘要
由于 CNN 等前沿技术的应用,未修剪视频中的事件分析引起了越来越多的关注。作为基于 CNN 模型的良好研究特性,感受野是衡量单个特征响应所覆盖空间范围的指标,对提升图像分类精度至关重要。在视频领域,视频事件语义实际上由不同概念之间的复杂交互描述,而这些概念的行为在不同视频之间差异巨大,导致基于概念的精确事件分类分析十分困难。为建模概念行为,我们研究了基于概念的事件表示的时序概念感受野,其编码了不同中层概念的时间出现模式。相应地,我们引入时序动态卷积(TDC)以增强基于概念的事件分析的灵活性。TDC 可根据不同输入动态调整时序概念感受野大小。值得注意的是,学习一组系数来融合多个具有不同核宽度的卷积结果,这些卷积提供了不同的时序概念感受野大小。不同的系数可根据输入视频生成合适且准确的时序概念感受野大小,并突出关键概念。基于 TDC,我们提出时序动态概念建模网络(TDCMN)以学习准确且完整的概念表示,用于高效的未修剪视频分析。在 FCVID 和 ActivityNet 上的实验结果表明,TDCMN 展现出基于不同输入的自适应事件识别能力,并大幅提升了基于概念方法的事件识别性能。代码见 https://github.com/qzhb/TDCMN。
引用
@article{arxiv.2111.11653,
title = {Modeling Temporal Concept Receptive Field Dynamically for Untrimmed Video Analysis},
author = {Zhaobo Qi and Shuhui Wang and Chi Su and Li Su and Weigang Zhang and Qingming Huang},
journal= {arXiv preprint arXiv:2111.11653},
year = {2021}
}