利用下一活动对象实现以自我中心视频中上下文感知的预判
计算机视觉与模式识别
2023-10-06 v3
摘要
物体对于理解人-物交互至关重要。通过识别相关物体,也可预测这些物体上可能发生的潜在未来交互或动作。本文研究短时对象交互预判(STA)问题,并提出 NAOGAT(下一活动对象引导的预判 Transformer),一种多模态端到端 transformer 网络,其关注已观测帧中的物体,以预判下一活动对象(NAO),并最终引导模型预测上下文感知的未来动作。该任务具有挑战性,因为它要求预判未来动作、动作所作用的对象以及交互开始后的时间,即接触时间(TTC)。与现有的用于动作预判的视频建模范式相比,NAOGAT 捕捉物体与全局场景上下文之间的关系,以基于这些检测预测下一活动对象的检测框并预判相关未来动作,利用物体动态提升准确性。事实上,我们方法的关键优势之一是其利用给定片段内物体运动动态的能力(常被其他模型忽略),并分别解码以对象为中心与以运动为中心的信息。通过实验,我们表明在 Ego4D 和 EpicKitchens-100(“Unseen Set”)两个独立数据集上,按接触时间、下一活动对象定位等若干附加指标衡量,我们的模型优于现有方法。代码将在接收后公开。
引用
@article{arxiv.2308.08303,
title = {Leveraging Next-Active Objects for Context-Aware Anticipation in Egocentric Videos},
author = {Sanket Thakur and Cigdem Beyan and Pietro Morerio and Vittorio Murino and Alessio Del Bue},
journal= {arXiv preprint arXiv:2308.08303},
year = {2023}
}
备注
Accepted in WACV'24