中文

SAFCAR:用于组合动作识别的结构化注意力融合

计算机视觉与模式识别 2020-12-21 v2

摘要

我们提出一个用于组合动作识别的通用框架——即动作标签由主体、原子动作和对象等更简单组件组合而成的动作识别。组合动作识别的主要挑战在于,使用基本组件可组合出的可能动作集合呈组合式增长。然而,组合性也提供了一种可被利用的结构。为此,我们开发并测试了一种新颖的结构化注意力融合(Structured Attention Fusion, SAF)自注意力机制,将来自目标检测(捕捉动作的时间序列结构)的信息与捕捉上下文信息的视觉线索相结合。我们表明,相较于当前最先进(state of the art)系统,我们的方法能更有效地识别新颖的动词-名词组合,并且仅从少量标注样本中就能高效地泛化到未见的动作类别。我们在 Something-Something-V2 数据集上具挑战性的 Something-Else 任务验证了我们的方法。我们进一步表明,我们的框架具有灵活性,通过在 Charades-Fewshot 数据集上展示具竞争力的结果,可泛化到新领域。

关键词

引用

@article{arxiv.2012.02109,
  title  = {SAFCAR: Structured Attention Fusion for Compositional Action Recognition},
  author = {Tae Soo Kim and Gregory D. Hager},
  journal= {arXiv preprint arXiv:2012.02109},
  year   = {2020}
}