中文

面向可扩展视频叙述:一种无训练方法

计算机视觉与模式识别 2025-07-24 v1

摘要

本文介绍了 VideoNarrator,一种新颖的无训练管道,旨在生成密集视频描述,提供视频内容的结构化快照。这些描述包含精确的时间戳,捕捉每个视频片段中的细微差别。尽管多模态大语言模型 (MLLM) 在视频理解方面取得了进展,但这些模型常常在时序对齐的叙述方面困难,尤其是在不熟悉的场景中容易产生幻觉。VideoNarrator 通过利用灵活的管道,其中即插即用的 MLLM 和视觉-语言模型 (VLM) 可作为描述生成器、上下文提供者或描述验证器发挥作用。我们的实验结果表明,这些组件的协同作用显著提高了视频叙述的质量和准确性,有效减少了幻觉现象,提高了时序对齐。这种结构化方法不仅增强了视频理解,还促进了下游任务,如视频摘要和视频问答,可能还可用于广告和营销应用。

关键词

引用

@article{arxiv.2507.17050,
  title  = {Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models},
  author = {Tz-Ying Wu and Tahani Trigui and Sharath Nittur Sridhar and Anand Bodas and Subarna Tripathi},
  journal= {arXiv preprint arXiv:2507.17050},
  year   = {2025}
}

备注

Accepted to CVAM Workshop at ICCV 2025