DenseStep2M:用于密集指令视频标注的可扩展、无训练管道
计算机视觉与模式识别
2026-04-30 v1
摘要
长期视频理解需要解释复杂的时序事件并对程序性活动进行推理。虽然 instructional video 语料库(如 HowTo100M)为模型训练提供了丰富资源,但它们面临着显著挑战,包括 ASR 转录噪声和 narration 与视觉内容之间的时间对齐不一致。在本工作中,我们引入了一个自动化、无训练管道,从野生 instructional video 中提取高质量的程序性标注。我们的方法将视频分割为连贯的镜头,过滤努力对齐的内容,并利用最先进的多模态和大型语言模型(Qwen2.5-VL 和 DeepSeek-R1)生成结构化、时序对齐的程序步骤。该管道产生 DenseStep2M,一个大型数据集,包含约 10 万个视频和 200 万条详细的指令步骤,旨在支持全面的长期视频理解。为严格评估我们的管道,我们策划了 DenseCaption100,一个高质量、人工书写标题的基准。评估显示,我们自动生成的步骤与人类注释之间的对齐程度很强。此外,我们在三个核心下游任务上验证了 DenseStep2M 的实用性:密集视频标题、程序步骤定位和跨模态检索。在 DenseStep2M 上微调的模型在标题质量和时序局部化方面实现了显著提升,同时在 egocentric、exocentric 和混合视角领域中表现出稳健的零样本泛化。这些结果凸显了 DenseStep2M 在促进高级多模态对齐和长期活动推理方面的有效性。我们的数据集可在 https://huggingface.co/datasets/mingjige/DenseStep2M 获取。
引用
@article{arxiv.2604.26565,
title = {DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation},
author = {Mingji Ge and Qirui Chen and Zeqian Li and Weidi Xie},
journal= {arXiv preprint arXiv:2604.26565},
year = {2026}
}