分层视频时刻检索与步骤描述生成
计算机视觉与模式识别
2023-03-30 v1 人工智能
计算与语言
机器学习
摘要
从大型视频语料库中搜索信息正引起越来越多的关注。先前工作孤立地研究了相关任务,如基于文本的 video检索、时刻检索、视频摘要和视频描述生成,而没有一个可以联合从视频语料库搜索并生成摘要的端到端设置。这样的端到端设置将支持许多有趣应用,例如基于文本的搜索从视频语料库中找到相关视频,从该视频提取最相关时刻,并将时刻分割为带描述的关键步骤。为此,我们提出HiREST(分层检索与步骤描述生成)数据集并给出一个新基准,涵盖来自教学视频语料库的分层信息检索与视觉/文本逐步摘要。HiREST由来自教学视频数据集的3.4K文本-视频对组成,其中1.1K视频有与文本查询相关的时刻区间标注,并将每个时刻分解为带描述和时间戳的关键教学步骤(总计8.6K步骤描述)。我们的分层基准包含视频检索、时刻检索以及两个新颖的时刻分割与步骤描述任务。在时刻分割中,模型将视频时刻分解为教学步骤并识别起止边界。在步骤描述中,模型为每个步骤生成文本摘要。我们还给出了针对新基准的起始点任务特定及端到端联合基线模型。虽然基线模型显示出一些有前景的结果,但社区未来改进仍有很大空间。项目网站:https://hirest-cvpr2023.github.io
引用
@article{arxiv.2303.16406,
title = {Hierarchical Video-Moment Retrieval and Step-Captioning},
author = {Abhay Zala and Jaemin Cho and Satwik Kottur and Xilun Chen and Barlas Oğuz and Yasher Mehdad and Mohit Bansal},
journal= {arXiv preprint arXiv:2303.16406},
year = {2023}
}
备注
CVPR 2023 (15 pages; the first two authors contributed equally; Project website: https://hirest-cvpr2023.github.io)