中文

V2Xum-LLM: 基于时间提示指令微调的跨模态视频摘要

计算机视觉与模式识别 2025-10-09 v3 人工智能

摘要

视频摘要旨在创建较长视频的简短、准确且连贯的摘要。尽管存在各种视频摘要数据集,但一个显著的局限性是源视频数量有限,这阻碍了先进大型视觉语言模型(VLM)的有效训练。此外,大多数现有数据集是为视频到视频摘要创建的,忽视了当前对多模态视频内容摘要的需求。最近的努力已从单模态扩展到多模态视频摘要,根据摘要的模态将任务分为三个子任务:视频到视频(V2V)、视频到文本(V2T)以及视频和文本摘要的组合(V2VT)。然而,以往多模态数据集中的文本摘要不够充分。为了解决这些问题,我们引入了Instruct-V2Xum,一个跨模态视频摘要数据集,包含来自YouTube的30,000个多样化视频,长度从40秒到940秒,平均摘要比为16.39%。Instruct-V2Xum中的每个视频摘要都配有一个引用特定帧索引的文本摘要,便于生成对齐的视频和文本摘要。此外,我们提出了一个新的视频摘要框架V2Xum-LLM。V2Xum-LLM,特别是本研究中的V2Xum-LLaMA,是第一个将不同视频摘要任务统一到一个大型语言模型(LLM)文本解码器中,并通过时间提示和任务指令实现任务可控视频摘要的框架。实验表明,V2Xum-LLaMA在多个视频摘要任务上优于强基线模型。此外,我们为V2V和V2VT摘要任务提出了一个增强的评估指标。

关键词

引用

@article{arxiv.2404.12353,
  title  = {V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning},
  author = {Hang Hua and Yolo Yunlong Tang and Chenliang Xu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2404.12353},
  year   = {2025}
}

备注

Accepted to AAAI 2025