SAFCAR:用于组合动作识别的结构化注意力融合
计算机视觉与模式识别
2020-12-21 v2
摘要
我们提出一个用于组合动作识别的通用框架——即动作标签由主体、原子动作和对象等更简单组件组合而成的动作识别。组合动作识别的主要挑战在于,使用基本组件可组合出的可能动作集合呈组合式增长。然而,组合性也提供了一种可被利用的结构。为此,我们开发并测试了一种新颖的结构化注意力融合(Structured Attention Fusion, SAF)自注意力机制,将来自目标检测(捕捉动作的时间序列结构)的信息与捕捉上下文信息的视觉线索相结合。我们表明,相较于当前最先进(state of the art)系统,我们的方法能更有效地识别新颖的动词-名词组合,并且仅从少量标注样本中就能高效地泛化到未见的动作类别。我们在 Something-Something-V2 数据集上具挑战性的 Something-Else 任务验证了我们的方法。我们进一步表明,我们的框架具有灵活性,通过在 Charades-Fewshot 数据集上展示具竞争力的结果,可泛化到新领域。
引用
@article{arxiv.2012.02109,
title = {SAFCAR: Structured Attention Fusion for Compositional Action Recognition},
author = {Tae Soo Kim and Gregory D. Hager},
journal= {arXiv preprint arXiv:2012.02109},
year = {2020}
}