团结则立,分裂则败:用于视频无监督步骤学习的 UnityGraph
计算机视觉与模式识别
2023-11-08 v1 人工智能
摘要
给定同一任务的多个视频,步骤学习旨在识别关键步骤并确定其执行顺序。为此,现有方法利用由一对视频生成的信号。这使得关键步骤发现具有挑战性,因为算法缺乏视频间的视角。相反,我们提出一种无监督的基于图的步骤学习(GPL)框架。GPL 包含新颖的 UnityGraph,其将某一任务的所有视频表示为图,以获取视频内与视频间的上下文。此外,为对相同关键步骤获得相似嵌入,UnityGraph 的嵌入使用 Node2Vec 算法以无监督方式更新。最后,为识别关键步骤,我们使用 KMeans 对嵌入进行聚类。我们在基准 ProceL、CrossTask 与 EgoProceL 数据集上测试 GPL,相较最先进水平,在第三人称数据集上平均提升 2%,在 EgoProceL 上提升 3.6%。
引用
@article{arxiv.2311.03550,
title = {United We Stand, Divided We Fall: UnityGraph for Unsupervised Procedure Learning from Videos},
author = {Siddhant Bansal and Chetan Arora and C. V. Jawahar},
journal= {arXiv preprint arXiv:2311.03550},
year = {2023}
}
备注
13 pages, 6 figures, Accepted in Winter Conference on Applications of Computer Vision (WACV), 2024