中文

教学视频中任务结构的学习与验证

计算机视觉与模式识别 2023-03-24 v1 人工智能 计算与语言 机器学习

摘要

鉴于在线可获取的教学视频数量庞大,从视频中学习多样化多步任务模型是一个引人瞩目的目标。我们引入一个新的预训练视频模型 VideoTaskformer,专注于表示教学视频的语义与结构。我们使用一个简单而有效的目标预训练 VideoTaskformer:预测从教学视频中随机掩去的步骤的弱监督文本标签(掩码步骤建模)。与先前局部学习步骤表示的工作不同,我们的方法全局地学习它们,利用整个周边任务的视频作为上下文。从这些学到的表示中,我们可以验证未见视频是否正确执行给定任务,以及预测在给定步骤后可能采取的步骤。我们引入两个用于检测教学视频中错误的新基准,以验证是否存在异常步骤以及步骤是否以正确顺序执行。我们还引入一个长期预测基准,目标是从给定步骤预测长距离未来步骤。我们的方法在这些任务上优于先前基线,且我们相信这些任务将成为社区衡量步骤表示质量的宝贵方式。此外,我们在 3 个现有基准——过程活动识别、步骤分类和步骤预测——上评估 VideoTaskformer,并在每个上展示我们的方法优于现有基线且达到新的 SOTA 性能。

关键词

引用

@article{arxiv.2303.13519,
  title  = {Learning and Verification of Task Structure in Instructional Videos},
  author = {Medhini Narasimhan and Licheng Yu and Sean Bell and Ning Zhang and Trevor Darrell},
  journal= {arXiv preprint arXiv:2303.13519},
  year   = {2023}
}

备注

Wesbite at https://medhini.github.io/task_structure