中文

STEPs:从无标注流程视频中进行自监督关键步骤提取与定位

计算机视觉与模式识别 2023-09-12 v3

摘要

我们致力于解决从无标注流程视频中提取关键步骤的问题,其动机在于增强现实(AR)头显在革新岗位培训与作业表现方面的潜力。我们将该问题分解为两步:表示学习与关键步骤提取。我们提出了一种训练目标,即自举多线索对比(BMC2)损失,以在无任何标签的情况下为各步骤学习判别性表示。与先前工作不同,我们开发了相关技术来训练一个轻量级时序模块,该模块使用现成特征进行自监督。我们的方法可无缝利用光流、深度或注视等多种线索的信息来学习关键步骤的判别性特征,从而适用于 AR 应用。我们最终通过一种可调算法提取关键步骤,该算法对表示与样本进行聚类并采样。我们在关键步骤定位与阶段分类任务上展示了相较先前工作的显著提升。定性结果表明,所提取的关键步骤具有意义,并能简洁地表示流程任务的各个步骤。

关键词

引用

@article{arxiv.2301.00794,
  title  = {STEPs: Self-Supervised Key Step Extraction and Localization from Unlabeled Procedural Videos},
  author = {Anshul Shah and Benjamin Lundell and Harpreet Sawhney and Rama Chellappa},
  journal= {arXiv preprint arXiv:2301.00794},
  year   = {2023}
}

备注

Accepted at ICCV 2023