中文

DreamFrame:通过自动生成的问答和风格一致关键帧增强视频理解

计算机视觉与模式识别 2025-08-12 v5

摘要

近期用于视频理解的大型视觉语言模型主要通过从在线平台抓取的各种视频进行微调。现有数据集(如 ActivityNet)在有效用于调优 LVLM 之前,需要大量人工进行结构和标注。虽然当前的 LVLM 主要在广泛、通用的场景下基于现有数据集进行训练,但将它们适配到特定的下游场景仍然具有挑战性,因为收集和标注特定任务的视频非常耗费人力和时间。为解决此问题,我们提出了一个名为 DreamFrame 的三阶段框架,用于自动生成风格一致的关键帧和相应的问答对,以支持 LVLM 的指令微调。DreamFrame 以电影式的方式生成数据集。首先,我们利用 LLM 生成结构化的电影情节,包括电影先验信息(如概要和风格)、帧描述和与情节相关的问答对,并采用故事扩展策略来缓解上下文长度限制。然后,为确保生成帧之间的视觉一致性,我们设计了一个风格固定过程,通过嵌入学习策略保持一致的风格。最后,将帧描述和风格嵌入整合以生成连贯的关键帧。使用 DreamFrame,我们构建了一个包含约 1k 个风格化关键帧式视频和 100k 个多样化问答对的数据集。在各种 LVLM 架构上进行的大量微调实验证明了所提出数据集的有效性。此外,基于该数据集,我们微调了一个名为 DreamFrame-7B 的新 LVLM,它在不同基准测试上显著超越了之前类似规模的 LVLM。

关键词

引用

@article{arxiv.2403.01422,
  title  = {DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes},
  author = {Zhende Song and Chenchen Wang and Jiamu Sheng and Chi Zhang and Shengji Tang and Jiayuan Fan and Tao Chen},
  journal= {arXiv preprint arXiv:2403.01422},
  year   = {2025}
}

备注

Accepted by ACMM'MM 2025