中文

基于文本监督与事件引导的教学视频过程规划

计算机视觉与模式识别 2023-08-21 v1

摘要

在本工作中,我们关注基于文本监督的教学视频过程规划任务,其中模型旨在预测一个动作序列,将初始视觉状态转换为目标视觉状态。该任务的一个关键挑战是被忽略的观测视觉状态与未观测中间动作之间的巨大语义鸿沟。具体而言,该语义鸿沟是指观测视觉状态中的内容在语义上不同于过程中某些动作文本标签的要素。为弥合这一语义鸿沟,我们提出了一种新颖的事件引导范式,其首先从观测状态推断事件,然后基于状态和预测事件规划出动作。我们的灵感来源于:从教学视频规划过程即完成特定事件,而特定事件通常涉及特定动作。基于所提范式,我们贡献了一个事件引导的基于提示的过程规划(E3P)模型,其将事件信息编码进序列建模过程以支持过程规划。为进一步考虑各事件内强烈的动作关联,我们的 E3P 采用掩码-预测方法进行关系挖掘,并引入概率掩码方案作为正则化。在三个数据集上的大量实验证明了我们所提模型的有效性。

关键词

引用

@article{arxiv.2308.08885,
  title  = {Event-Guided Procedure Planning from Instructional Videos with Text Supervision},
  author = {An-Lan Wang and Kun-Yu Lin and Jia-Run Du and Jingke Meng and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2308.08885},
  year   = {2023}
}

备注

Accepted to ICCV 2023