中文

利用注意力字典学习识别第一人称视频中物体上的动作

计算机视觉与模式识别 2021-02-17 v1

摘要

我们提出EgoACO,一种用于视频动作识别的深度神经架构,它通过利用第一人称视频数据集中动作标签的动词-名词结构,学习从帧级特征中汇聚动作-上下文-物体描述子。EgoACO的核心组件是类激活汇聚(CAP),一种可微汇聚操作,它结合了细粒度识别中双线性汇聚的思想与用于判别性定位的特征学习思想。CAP使用带有可学习权重字典的自注意力从最相关的特征区域进行汇聚。通过CAP,EgoACO学习从视频帧特征中解码物体与场景上下文描述子。对于EgoACO中的时间建模,我们设计了类激活汇聚的循环版本,称为长短期注意力(LSTA)。LSTA以内置空间注意力和重新设计的输出门扩展了卷积门控LSTM。动作、物体和上下文描述子通过多头部预测进行融合,该预测考虑了第一人称视频数据集中名词-动词-动作结构化标签之间的相互依赖关系。EgoACO具有内置的视觉解释功能,有助于学习与解释。在现有两个最大的第一人称动作识别数据集EPIC-KITCHENS和EGTEA上的结果表明,通过显式解码动作-上下文-物体描述子,EgoACO达到了最先进的识别性能。

关键词

引用

@article{arxiv.2102.08065,
  title  = {Learning to Recognize Actions on Objects in Egocentric Video with Attention Dictionaries},
  author = {Swathikiran Sudhakaran and Sergio Escalera and Oswald Lanz},
  journal= {arXiv preprint arXiv:2102.08065},
  year   = {2021}
}

备注

Accepted to TPAMI