StepFormer:教学视频中自监督步骤发现与定位
计算机视觉与模式识别
2023-04-27 v1
摘要
教学视频是从人类演示中学习程序性任务的重要资源。然而,此类视频中的教学步骤通常短暂且稀疏,大部分视频与流程无关。这催生了对此类视频中教学步骤进行时间定位的需求,即称为关键步骤定位的任务。传统的关键步骤定位方法需要视频级人工标注,因此无法扩展到大型数据集。在本工作中,我们在无人工监督的情况下解决该问题,并引入 StepFormer,一种在教学视频中发现并定位教学步骤的自监督模型。StepFormer 是一个用可学习查询关注视频的 transformer 解码器,并产生捕获视频中关键步骤的槽序列。我们在大型教学视频数据集上训练我们的系统,仅使用其自动生成的字幕作为唯一的监督来源。特别地,我们使用有序感知损失函数以文本叙述序列监督我们的系统,该函数过滤掉无关短语。我们表明,在三个具有挑战性的基准上,我们的模型在步骤检测和定位上大幅优于所有先前的无监督和弱监督方法。此外,我们的模型展现出解决零样本多步骤定位的涌现能力,并在该任务上优于所有相关基线。
引用
@article{arxiv.2304.13265,
title = {StepFormer: Self-supervised Step Discovery and Localization in Instructional Videos},
author = {Nikita Dvornik and Isma Hadji and Ran Zhang and Konstantinos G. Derpanis and Animesh Garg and Richard P. Wildes and Allan D. Jepson},
journal= {arXiv preprint arXiv:2304.13265},
year = {2023}
}
备注
CVPR'23