中文

LongCaptioning:解锁大型多模态模型中长视频描述生成的潜力

计算机视觉与模式识别 2025-03-04 v2

摘要

大型多模态模型(LMMs)在短视频视频描述任务中表现突出,但随着视频长度增加,生成长篇、详细描述的能力成为重要挑战。本文调查了 LMM 在生成长视频描述方面的局限性。我们的分析表明,开源 LMM 在持续生成超过 300 字的输出方面困难重重,导致对视觉内容的描述不完整或过于简略。这一局限性阻碍了 LMM 为长视频提供全面、详尽的描述,从而遗漏了重要的视觉信息。通过受控实验,我们发现训练过程中缺乏带有长描述的配对示例是限制模型输出长度的主要因素。然而,手动为长视频标注长描述示例代价高昂且耗时。为克服标注瓶颈,我们提出了 LongCaption-Agent 框架,通过层次化语义聚合合成长描述数据。% 聚合多级描述。我们利用 LongCaption-Agent 构建了一个新的长描述数据集,LongCaption-10K。我们还开发了 LongCaption-Bench,用于全面评估 LMM 生成长描述的质量。通过将 LongCaption-10K 纳入训练,我们使 LMM 能够为长视频生成超过 1000 字的描述,同时保持高质量。在 LongCaption-Bench 中,我们的模型实现了状态-of-the-art 性能,甚至超越了更大的专有模型如 GPT4o。

关键词

引用

@article{arxiv.2502.15393,
  title  = {LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models},
  author = {Hongchen Wei and Zhihong Tan and Yaosi Hu and Chang Wen Chen and Zhenzhong Chen},
  journal= {arXiv preprint arXiv:2502.15393},
  year   = {2025}
}