面向教学视频理解的过程感知预训练
计算机视觉与模式识别
2023-04-03 v1
摘要
我们的目标是从教学视频中学习一种对下游过程理解任务有用的视频表示。由于可用标注量少,过程理解的一个关键挑战是能够从无标签视频中提取过程知识,例如任务身份(如“制作拿铁”)、其步骤(如“倒入牛奶”),或给定执行部分进度时的潜在后续步骤。我们的主要洞见是:教学视频描绘了在相同或不任务实例间重复的步骤序列,并且这种结构可由过程知识图(PKG)很好表示,其中节点为离散步骤,边连接教学活动中顺序发生的步骤。该图随后可用于生成伪标签,以训练将过程知识编码为更易获取形式从而泛化到多个过程理解任务的视频表示。我们通过结合基于文本的过程知识数据库与无标签教学视频语料库构建PKG,并用其以四个新颖预训练目标生成训练伪标签。我们将此基于PKG的预训练过程及所得模型称为Paprika,即面向教学知识获取的过程感知预训练(Procedure-Aware PRe-training for Instructional Knowledge Acquisition)。我们在COIN和CrossTask上评估Paprika在任务识别、步骤识别和步骤预测等过程理解任务上的表现。Paprika产生的视频表示优于当前最优:在12个评估设置中准确率提升高达11.23%。实现代码见 https://github.com/salesforce/paprika。
引用
@article{arxiv.2303.18230,
title = {Procedure-Aware Pretraining for Instructional Video Understanding},
author = {Honglu Zhou and Roberto Martín-Martín and Mubbasir Kapadia and Silvio Savarese and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:2303.18230},
year = {2023}
}
备注
CVPR 2023