Vript:一段视频胜过千言万语
计算机视觉与模式识别
2024-10-28 v2
摘要
多模态学习(尤其是在视频理解和生成方面)的进步,需要高质量的视频-文本数据集来提升模型性能。Vript通过一个精心标注的语料库解决了这个问题,该语料库包含12K个高分辨率视频,为超过420K个片段提供了详细、密集且类似脚本的标题。每个片段的标题约有145个词,比大多数视频-文本数据集长10倍以上。与先前数据集中仅记录静态内容的标题不同,我们通过不仅记录内容,还记录镜头操作(包括镜头类型(中景、特写等)和摄像机运动(平移、倾斜等)),将视频字幕生成增强为视频脚本生成。通过利用Vript,我们探索了三种训练范式,这些范式将更多文本与视频模态对齐,而不是与片段-标题对对齐。这产生了Vriptor,一个在开源模型中性能领先的视频字幕生成模型,其性能可与GPT-4V相媲美。Vriptor也是一个强大的模型,能够为长视频端到端地生成密集且详细的标题。此外,我们引入了Vript-Hard,这是一个由三个视频理解任务组成的基准,比现有基准更具挑战性:Vript-HAL是第一个评估视频大语言模型中动作和对象幻觉的基准;Vript-RR将推理与检索相结合,解决了长视频问答中的问题歧义;Vript-ERO是一项新任务,用于评估长视频中事件的时间理解,而非先前工作中短视频中的动作。所有代码、模型和数据集均可在 https://github.com/mutonix/Vript 获取。附注:我们在Vript系列中包含了更多的视频-文本数据集(Vript_CN 和 Vript_Multilingual)。
引用
@article{arxiv.2406.06040,
title = {Vript: A Video Is Worth Thousands of Words},
author = {Dongjie Yang and Suyuan Huang and Chengqiang Lu and Xiaodong Han and Haoxin Zhang and Yan Gao and Yao Hu and Hai Zhao},
journal= {arXiv preprint arXiv:2406.06040},
year = {2024}
}
备注
Accepted by NeurIPS Dataset & Benchmark track