面向长篇教学视频的多语句时序定位
计算机视觉与模式识别
2024-07-23 v2
摘要
本文旨在建立一个自动、可扩展的流水线,用于对大规模教学数据集进行去噪,并构建一个具有多描述步骤监督的高质量视频-文本数据集,命名为 HowToStep。我们做出以下贡献:(i) 通过升级 ASR 系统以减少语音识别错误,并提示大型语言模型将含噪 ASR 转录文本转换为描述性步骤,从而提高数据集中句子的质量;(ii) 提出一种基于 Transformer 的架构,将所有文本作为查询,迭代地关注视觉特征,以将生成的步骤在时间上对齐到相应的视频片段。为了衡量我们整理的数据集的质量,我们在其上训练了用于多语句时序定位任务的模型,即给定一个长视频和相关的多个句子,同时确定它们在视频中对应的时间戳。结果表明,该模型在一系列多语句时序定位任务上表现出卓越的性能,在三个公开基准上大幅超越现有 SOTA 方法,具体为 HT-Step 上 9.0%,HTM-Align 上 5.1%,CrossTask 上 1.9%。所有代码、模型和生成的数据集均已公开发布。
引用
@article{arxiv.2312.14055,
title = {Multi-Sentence Grounding for Long-term Instructional Video},
author = {Zeqian Li and Qirui Chen and Tengda Han and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2312.14055},
year = {2024}
}