中文

团结则立,分裂则败:用于视频无监督步骤学习的 UnityGraph

计算机视觉与模式识别 2023-11-08 v1 人工智能

摘要

给定同一任务的多个视频,步骤学习旨在识别关键步骤并确定其执行顺序。为此,现有方法利用由一对视频生成的信号。这使得关键步骤发现具有挑战性,因为算法缺乏视频间的视角。相反,我们提出一种无监督的基于图的步骤学习(GPL)框架。GPL 包含新颖的 UnityGraph,其将某一任务的所有视频表示为图,以获取视频内与视频间的上下文。此外,为对相同关键步骤获得相似嵌入,UnityGraph 的嵌入使用 Node2Vec 算法以无监督方式更新。最后,为识别关键步骤,我们使用 KMeans 对嵌入进行聚类。我们在基准 ProceL、CrossTask 与 EgoProceL 数据集上测试 GPL,相较最先进水平,在第三人称数据集上平均提升 2%,在 EgoProceL 上提升 3.6%。

关键词

引用

@article{arxiv.2311.03550,
  title  = {United We Stand, Divided We Fall: UnityGraph for Unsupervised Procedure Learning from Videos},
  author = {Siddhant Bansal and Chetan Arora and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2311.03550},
  year   = {2023}
}

备注

13 pages, 6 figures, Accepted in Winter Conference on Applications of Computer Vision (WACV), 2024