中文

利用远程监督学习识别程序性活动

计算机视觉与模式识别 2022-06-20 v3

摘要

在本文中,我们考虑从长达数分钟的长视频中对细粒度、多步骤活动(例如,烹饪不同食谱、进行不同的家庭改善、创作各种形式的艺术与手工艺)进行分类的问题。准确分类这些活动不仅需要识别组成任务的各个步骤,还需要捕捉它们的时间依赖关系。该问题与传统动作分类截然不同,在传统动作分类中,模型通常在仅持续几秒且被手动裁剪为包含简单原子动作的视频上进行优化。虽然步骤标注可以支持训练识别程序性活动各个步骤的模型,但由于在长视频中手动标注时间边界的成本过高,该领域现有大规模数据集不包含此类片段标签。为解决此问题,我们提出利用包含执行各种复杂活动所需步骤详细描述的文本知识库(wikiHow)的远程监督,自动识别教学视频中的步骤。我们的方法使用语言模型将视频中嘈杂的自动转写语音与知识库中的步骤描述进行匹配。我们证明,训练用于识别这些自动标注步骤(无人工监督)的视频模型所产生的表征,在四项下游任务上实现了优越的泛化性能:程序性活动识别、步骤分类、步骤预测和以自我为中心的视频分类。

关键词

引用

@article{arxiv.2201.10990,
  title  = {Learning To Recognize Procedural Activities with Distant Supervision},
  author = {Xudong Lin and Fabio Petroni and Gedas Bertasius and Marcus Rohrbach and Shih-Fu Chang and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2201.10990},
  year   = {2022}
}

备注

CVPR 2022. Code will be released here https://github.com/facebookresearch/video-distant-supervision