所言即所显:教学视频中的视觉叙述检测
计算机视觉与模式识别
2023-07-20 v2
摘要
带有旁白的“操作指南”视频已成为广泛学习问题的有前景数据源,从学习视觉表征到训练机器人策略。然而,该数据极其嘈杂,因为旁白并非总是描述视频中演示的动作。为解决此问题,我们引入视觉叙述检测这一新任务,即判断旁白是否被视频中的动作视觉呈现。我们提出 WYS^2(What You Say is What You Show,所言即所显),一种利用多模态线索和伪标记以仅用弱标记数据学习检测视觉叙述的方法。我们的模型成功检测野外视频中的视觉叙述,优于强基线,并展示了其对教学视频最先进摘要与时间对齐的影响。
引用
@article{arxiv.2301.02307,
title = {What You Say Is What You Show: Visual Narration Detection in Instructional Videos},
author = {Kumar Ashutosh and Rohit Girdhar and Lorenzo Torresani and Kristen Grauman},
journal= {arXiv preprint arXiv:2301.02307},
year = {2023}
}
备注
Technical Report