中文

用于捕捉视频中视觉变换的变换感兴趣区域

计算机视觉与模式识别 2022-11-08 v2

摘要

对动作给场景带来的视觉变化进行建模对于视频理解至关重要。当前,CNN 一次处理一个局部邻域,因此长距离的上下文关系虽仍可学习,却是间接的。我们提出 TROI,一种用于 CNN 的即插即用模块,用于在空间和时间上原本分离的中层特征表示之间进行推理。该模块关联局部化视觉实体(如手和交互物体),并直接在卷积层特征图中变换其对应的感兴趣区域。借助 TROI,我们在大规模数据集 Something-Something-V2 和 EPIC-Kitchens-100 上取得了最先进的动作识别结果。

关键词

引用

@article{arxiv.2106.03162,
  title  = {Transformed ROIs for Capturing Visual Transformations in Videos},
  author = {Abhinav Rai and Fadime Sener and Angela Yao},
  journal= {arXiv preprint arXiv:2106.03162},
  year   = {2022}
}

备注

CVIU 2022 - Computer Vision and Image Understanding