通过旁白学习将指导性文章在视频中定位
计算机视觉与模式识别
2023-06-07 v1 人工智能
摘要
在本文中,我们提出一种在带旁白的教程视频中定位程序性活动步骤的方法。为应对大规模标注数据的稀缺性,我们从语言知识库(wikiHow)中获取步骤描述,该库包含大量各类程序性任务的指导性文章。在没有任何形式的人工监督下,我们的模型通过匹配三种模态——帧、旁白与步骤描述——来学习将程序性文章的步骤在时间上定位到教程视频中。具体而言,我们的方法通过融合两条不同路径的信息将步骤对齐到视频:i) 步骤描述到帧的{\em 直接}对齐,ii) 由步骤到旁白与旁白到视频的对应组合得到的{\em 间接}对齐。值得注意的是,我们的方法通过利用顺序信息一次性对文章中全部步骤进行全局时间定位,并使用迭代精炼与激进过滤的步骤伪标签进行训练。为验证我们的模型,我们引入了一个新的评测基准——HT-Step——通过对 HowTo100M\footnote{测试服务器可在 \url{https://eval.ai/web/challenges/challenge-page/2082} 访问。} 的一个 124 小时子集使用源自 wikiHow 文章的步骤进行人工标注获得。在该基准以及 CrossTask 上的零样本评测上的实验表明,我们的多模态对齐相较若干基线与先前工作带来了显著提升。最后,我们展示了用于匹配旁白到视频的内部模块在 HTM-Align 旁白-视频对齐基准上大幅优于最先进水平。
引用
@article{arxiv.2306.03802,
title = {Learning to Ground Instructional Articles in Videos through Narrations},
author = {Effrosyni Mavroudi and Triantafyllos Afouras and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2306.03802},
year = {2023}
}
备注
17 pages, 4 figures and 10 tables