中文

利用引导注意力增强基于下一活动对象的自我中心动作预期

计算机视觉与模式识别 2023-06-26 v2

摘要

第一人称视频中的短期动作预期(STA)是一项具有挑战性的任务,涉及理解下一活动对象的交互并预测未来动作。现有的动作预期方法主要关注利用从视频片段中提取的特征,但往往忽视了对象及其交互的重要性。为此,我们提出一种新颖方法,在对象与从视频片段提取的时空特征之间应用引导注意力机制,增强运动与上下文信息,并进一步解码以对象为中心和以运动为中心的信息,以解决自我中心视频中的 STA 问题。我们的方法 GANO(Guided Attention for Next active Objects)是一个多模态、端到端、基于单一 transformer 的网络。在最大的自我中心数据集上的实验结果表明,GANO 在预测下一活动对象标签、其边界框位置、相应未来动作以及接触对象的时间方面优于现有的最先进方法。消融研究显示了引导注意力机制相对于其他融合方法的积极贡献。此外,仅通过将可学习对象令牌与感兴趣区域嵌入拼接,即可改进 GANO 的下一活动对象位置与类别标签预测结果。

关键词

引用

@article{arxiv.2305.12953,
  title  = {Enhancing Next Active Object-based Egocentric Action Anticipation with Guided Attention},
  author = {Sanket Thakur and Cigdem Beyan and Pietro Morerio and Vittorio Murino and Alessio Del Bue},
  journal= {arXiv preprint arXiv:2305.12953},
  year   = {2023}
}

备注

Accepted to IEEE ICIP 2023, see project page here : https://sanketsans.github.io/guided-attention-egocentric.html