Wolf:基于世界概述框架的视频字幕生成
机器学习
2025-03-21 v2 计算与语言
计算机视觉与模式识别
摘要
我们提出了 Wolf,一种 WOrLd summarization Framework,用于准确视频字幕生成。Wolf 是一种自动字幕生成框架,采用混合专家方法,利用视觉语言模型(Vision Language Models, VLMs)的互补优势。通过同时利用图像模型和视频模型,我们的框架高效地捕获不同层次的信息。我们的做法可以用于增强视频理解、自动标注和字幕生成。为评估字幕质量,我们引入 CapScore,这是一种基于大语言模型的指标,用于评估生成字幕与真实字幕之间的相似性和质量。我们进一步构建了四个在三个领域中进行的人工标注数据集:自动驾驶、一般场景和机器人领域,以促进全面比较。我们表明,Wolf 在来自研究社区的先进方法(VILA1.5、CogAgent)和商业解决方案(Gemini-Pro-1.5、GPT-4V)中实现了优异的字幕生成性能。例如,与 GPT-4V 相比,Wolf 在具有挑战性的驾驶视频中通过 CapScore 质量提升 55.6%,相似度提升 77.4%。最后,我们建立了一个视频字幕基准,引入排行榜,旨在加快视频理解、字幕生成和数据对齐方面的发展。网页:https://wolfv0.github.io/。
引用
@article{arxiv.2407.18908,
title = {Wolf: Dense Video Captioning with a World Summarization Framework},
author = {Boyi Li and Ligeng Zhu and Ran Tian and Shuhan Tan and Yuxiao Chen and Yao Lu and Yin Cui and Sushant Veer and Max Ehrlich and Jonah Philion and Xinshuo Weng and Fuzhao Xue and Linxi Fan and Yuke Zhu and Jan Kautz and Andrew Tao and Ming-Yu Liu and Sanja Fidler and Boris Ivanovic and Trevor Darrell and Jitendra Malik and Song Han and Marco Pavone},
journal= {arXiv preprint arXiv:2407.18908},
year = {2025}
}