中文

学习重构动作与共生特征用于时序动作定位

计算机视觉与模式识别 2022-06-24 v1

摘要

时序动作定位的主要挑战是从未裁剪视频中各种共生成分(如上下文与背景)里检索细微人体动作。尽管先前方法通过设计先进动作检测器已取得实质进展,仍受这些常在视频中主导实际动作内容的共生成分所困。本文探究视频片段两个正交但互补的方面,即动作特征与共生特征。特别地,我们开发一种新颖辅助任务,通过解耦视频片段内这两类特征并重组以生成具有更显著动作信息的新特征表示,从而实现准确动作定位。我们将该方法称为RefactorNet,其首先显式分解动作内容并正则化其共生特征,随后合成新的动作主导视频表示。在THUMOS14与ActivityNet v1.3上的大量实验结果和消融研究证明,我们的新表示结合简单动作检测器即可显著提升动作定位性能。

关键词

引用

@article{arxiv.2206.11493,
  title  = {Learning to Refactor Action and Co-occurrence Features for Temporal Action Localization},
  author = {Kun Xia and Le Wang and Sanping Zhou and Nanning Zheng and Wei Tang},
  journal= {arXiv preprint arXiv:2206.11493},
  year   = {2022}
}

备注

Accepted by CVPR 2022