用于第一人称视频长时理解的动作场景图
计算机视觉与模式识别
2023-12-07 v1
摘要
我们提出了第一人称动作场景图(EASGs),一种用于第一人称视频长时理解的新表示。EASGs通过提供基于图的随时间演变的描述,包括相机佩戴者执行的动作、交互对象、它们的关系以及动作如何随时间展开,扩展了标准的手动标注的第一人称视频表示(如动词-名词动作标签)。通过一种新颖的标注流程,我们扩展了Ego4D数据集,添加了手动标注的第一人称动作场景图,为长时第一人称视频理解提供了丰富的标注集。我们因此定义了EASG生成任务,并提供了一种基线方法,建立了初步基准。在两个下游任务(第一人称动作预期和第一人称活动摘要)上的实验突出了EASGs在长时第一人称视频理解中的有效性。我们将发布数据集以及用于复现实验和标注的代码。
引用
@article{arxiv.2312.03391,
title = {Action Scene Graphs for Long-Form Understanding of Egocentric Videos},
author = {Ivan Rodin and Antonino Furnari and Kyle Min and Subarna Tripathi and Giovanni Maria Farinella},
journal= {arXiv preprint arXiv:2312.03391},
year = {2023}
}