利用特权信息进行第一人称动作识别的共生注意力方法
计算机视觉与模式识别
2020-02-11 v1
摘要
第一人称视频识别是进行多样化交互推理的自然试验场。由于第一人称视频数据集中动作词汇量大,近期研究通常采用双分支结构进行动作识别,即一个分支用于动词分类,另一个分支用于名词分类。然而,动词与名词分支之间的相关性研究在很大程度上被忽视。此外,由于缺乏位置感知注意力机制,两个分支未能利用局部特征。本文中,我们提出一种利用特权信息(SAP)的新型共生注意力框架用于第一人称视频识别。更精细的位置感知目标检测特征有助于理解执行者对物体的交互。我们在动作识别中引入这些特征并将其视为特权信息。我们的框架实现了动词分支、名词分支与特权信息之间的相互通信。该通信过程不仅将局部细节注入全局特征,还利用了关于进行中动作的时空位置的隐式引导。我们引入新型共生注意力(SA)以实现有效通信。它首先对一个分支上检测引导的特征进行归一化,以凸显来自另一分支的与动作相关的信息。SA 自适应地增强三个来源之间的交互。为进一步催化该通信,揭示空间关系以选择最相关的动作信息。它识别出对分类最有价值且最具判别力的特征。我们从定量与定性上验证了 SAP 的有效性。值得注意的是,它在两个大规模第一人称视频数据集上达到了最先进的性能。
引用
@article{arxiv.2002.03137,
title = {Symbiotic Attention with Privileged Information for Egocentric Action Recognition},
author = {Xiaohan Wang and Yu Wu and Linchao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2002.03137},
year = {2020}
}
备注
AAAI-2020(Oral)