中文

面向第一人称动作识别的自由形式组合网络

计算机视觉与模式识别 2023-10-17 v2

摘要

第一人称动作识别在人类动作识别领域正受到广泛关注。本文从组合泛化的角度解决第一人称动作识别中的数据稀缺问题。为此,我们提出一种自由形式组合网络(FFCN),该网络能够同时学习解耦的动词、介词和名词表示,并在特征空间中利用它们为稀有动作视频类别组合新样本。首先,我们使用图来捕获每个动作视频中不同手/物体实例之间的时空关系。由此,我们利用图中的边特征将每个动作分解为一组动词和介词的时空表示。时间分解从不同的视频帧中提取动词和介词表示,而空间分解则从每帧中与动作相关的实例中自适应地学习动词和介词表示。利用这些动词和介词的时空表示,我们可以以自由形式(不局限于动词加名词的刚性形式)为那些稀有类别组合新样本。所提出的 FFCN 可直接为稀有类别生成新的训练数据样本,从而显著提升动作识别性能。我们在三个流行的第一人称动作识别数据集 Something-Something V2、H2O 和 EPIC-KITCHENS-100 上评估了我们的方法,实验结果表明该方法在处理数据稀缺问题(包括长尾和少样本第一人称动作识别)方面的有效性。

关键词

引用

@article{arxiv.2307.06527,
  title  = {Free-Form Composition Networks for Egocentric Action Recognition},
  author = {Haoran Wang and Qinghua Cheng and Baosheng Yu and Yibing Zhan and Dapeng Tao and Liang Ding and Haibin Ling},
  journal= {arXiv preprint arXiv:2307.06527},
  year   = {2023}
}