长时 instructional 视频的多句定位
计算机视觉与模式识别
2023-12-22 v1
摘要
在本文中,我们旨在建立一个自动化的、可扩展的流程,用于去噪大规模 instructional 数据集,并构建一个具有多描述步骤监督的高质量视频 - 文本数据集,名为 HowToStep。我们做出了以下贡献:(i) 通过升级自动语音识别 (ASR) 系统以减少语音识别错误,并提示大型语言模型将嘈杂的 ASR 转录稿转换为描述性步骤,从而提高数据集中句子的质量;(ii) 提出一种基于 Transformer 的架构,将所有文本作为查询,迭代地关注视觉特征,以将生成的步骤在时间上与相应的视频片段对齐。为了衡量我们策划的数据集的质量,我们在其上训练了多句定位任务模型,即给定一个长格式视频和相关的多个句子,同时确定它们在视频中的对应时间戳;结果表明,该模型在一系列多句定位任务上表现出卓越的性能,在三个公共基准测试上显著超越了现有的最先进方法,即在 HT-Step 上提高了 9.0%,在 HTM-Align 上提高了 5.1%,在 CrossTask 上提高了 1.9%。所有代码、模型和生成的数据集均已公开发布。
引用
@article{arxiv.2312.14053,
title = {Dual Attention U-Net with Feature Infusion: Pushing the Boundaries of Multiclass Defect Segmentation},
author = {Rasha Alshawi and Md Tamjidul Hoque and Md Meftahul Ferdaus and Mahdi Abdelguerfi and Kendall Niles and Ken Prathak and Joe Tom and Jordan Klein and Murtada Mousa and Johny Javier Lopez},
journal= {arXiv preprint arXiv:2312.14053},
year = {2023}
}
备注
under review in IEEE Transactions on Artificial Intelligence