中文

用于视频识别的分组上下文化

计算机视觉与模式识别 2022-03-21 v1 多媒体

摘要

从复杂时空动态空间中学习判别性表示对视频识别至关重要。在那些风格化时空计算单元之上,进一步用轴向上下文精炼所学特征已被证明有望实现该目标。然而,先前工作通常聚焦于利用单一上下文校准整个特征通道,难以应对多样视频活动。该问题可通过成对时空注意力以跨轴上下文重算特征响应来解决,但代价是沉重计算量。本文提出一种高效特征精炼方法,将特征通道分解为若干组并并行地以不同轴向上下文分别精炼。我们将这种轻量特征校准称为分组上下文化(GC)。具体地,我们设计了一系列高效逐元素校准器,即 ECal-G/S/T/L,其轴向上下文是从其他轴全局或局部聚合的信息动态,用以对特征通道组进行上下文化。GC 模块可密集插入即用视频网络的每个残差层。在计算开销极小的情况下,在不同网络插入 GC 均观察到一致提升。通过利用校准器并行嵌入四种不同上下文的特征,所学表示有望对多样活动类型更具韧性。在具有丰富时间变化的视频上,经验上 GC 能将 2D-CNN(如 TSN 和 TSM)性能提升至与最先进视频网络相当水平。代码见 https://github.com/haoyanbin918/Group-Contextualization。

关键词

引用

@article{arxiv.2203.09694,
  title  = {Group Contextualization for Video Recognition},
  author = {Yanbin Hao and Hao Zhang and Chong-Wah Ngo and Xiangnan He},
  journal= {arXiv preprint arXiv:2203.09694},
  year   = {2022}
}