Graph2Vid:面向弱监督多步定位的流程图到视频定位
计算机视觉与模式识别
2022-11-01 v2 人工智能
摘要
在本工作中,我们考虑了教学视频中的弱监督多步定位问题。解决该问题的一种成熟方法是依赖给定的步骤列表。然而在现实中,通常有不止一种方法可以通过以略微不同的顺序执行该步骤集来成功完成一个程序。因此,为了在给定视频中进行成功的定位,近期的工作需要人工标注者在训练和测试阶段都提供视频中程序步骤的实际顺序。相反,这里我们仅依赖于不与特定视频绑定的通用程序文本。我们通过将指令列表转换为捕获步骤偏序的过程流程图,来表示完成程序的各种方式。使用流程图减少了训练和测试时间的标注需求。为此,我们引入了流程图到视频定位的新问题。在这种设置中,我们寻找与过程流程图和给定视频相一致的最优步骤排序。为了解决这个问题,我们提出了一种新算法——Graph2Vid——它推断视频中步骤的实际顺序并同时对其进行定位。为了展示我们提出公式的优势,我们用过程流程图信息扩展了 CrossTask 数据集。我们的实验表明,Graph2Vid 不仅比基线更高效,而且无需步骤顺序标注即可产生强大的步骤定位结果。
引用
@article{arxiv.2210.04996,
title = {Graph2Vid: Flow graph to Video Grounding for Weakly-supervised Multi-Step Localization},
author = {Nikita Dvornik and Isma Hadji and Hai Pham and Dhaivat Bhatt and Brais Martinez and Afsaneh Fazly and Allan D. Jepson},
journal= {arXiv preprint arXiv:2210.04996},
year = {2022}
}
备注
ECCV'22, oral