中文

我的视角最佳视角:基于第一人称视频的流程学习

计算机视觉与模式识别 2022-07-25 v1 人工智能

摘要

流程学习涉及识别关键步骤并确定其执行任务的逻辑顺序。现有方法通常使用第三人称视频来学习流程,使得被操作物体外观较小且常被执行者遮挡,导致显著误差。相反,我们观察到由第一人称(自我中心)可穿戴相机获取的视频提供了无遮挡且清晰的动作视图。然而,基于自我中心视频的流程学习具有挑战性,因为(a)由于佩戴者头部运动,相机视角经历剧烈变化,以及(b)由于视频的无约束性质而存在不相关帧。因此,当前最先进方法关于动作近似同时发生且持续时间相同的假设不再成立。为此,我们提出利用跨视频关键步骤间时间对应所提供的信号。为此,我们提出了一种新颖的自监督对应与裁剪(CnC)流程学习框架。CnC识别并利用多个视频间关键步骤的时间对应关系来学习流程。我们的实验表明,CnC在基准ProceL和CrossTask数据集上分别优于最先进方法5.2%和6.3%。此外,针对使用自我中心视频的流程学习,我们提出了EgoProceL数据集,包含130名受试者执行16项任务所捕获的62小时视频。源代码与数据集可在项目页面 https://sid2697.github.io/egoprocel/ 获取。

关键词

引用

@article{arxiv.2207.10883,
  title  = {My View is the Best View: Procedure Learning from Egocentric Videos},
  author = {Siddhant Bansal and Chetan Arora and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2207.10883},
  year   = {2022}
}

备注

25 pages, 6 figures, Accepted in European Conference on Computer Vision (ECCV) 2022