中文

面向第一人称视频的下一活动对象预测

计算机视觉与模式识别 2024-05-02 v5

摘要

本文解决在给定第一人称视频片段中、任何动作发生之前预测未来下一活动对象位置(可能发生接触的位置)的问题。该问题相当困难,因为我们的目标是在观测片段与动作片段被所谓“接触时间”(TTC)片段隔开的情况下估计此类对象的位置。已有许多方法基于先前的手部运动及与周围环境的互动来预测人的动作。然而,尚未有研究尝试探究下一可能交互对象及其相对于第一人称运动与 TTC 窗口内视场漂移的未来位置。我们将此定义为预测下一活动对象(ANACTO)任务。为此,我们提出一种基于 transformer 的自注意力框架,以在第一人称片段中识别并定位下一活动对象。我们在三个数据集上评测了我们的方法:EpicKitchens-100、EGTEA+ 和 Ego4D。我们也为前两个数据集提供了标注。与相关基线方法相比,我们的方法表现最佳。我们还进行了消融实验,以理解所提出方法和基线方法在不同条件下的有效性。代码与 ANACTO 任务标注将在论文被接收后公开。

关键词

引用

@article{arxiv.2302.06358,
  title  = {Anticipating Next Active Objects for Egocentric Videos},
  author = {Sanket Thakur and Cigdem Beyan and Pietro Morerio and Vittorio Murino and Alessio Del Bue},
  journal= {arXiv preprint arXiv:2302.06358},
  year   = {2024}
}

备注

Accepted by IEEE ACCESS, this paper carries the Manuscript DOI: 10.1109/ACCESS.2024.3395282. The complete peer-reviewed version is available via this DOI, while the arXiv version is a post-author manuscript without peer-review