中文

评估新闻视频自动标题生成中开源视频大语言模型的基准方法

计算机视觉与模式识别 2026-03-31 v1

摘要

新闻视频是电视台和在线流媒体平台生产的最常见内容类型,但生成文本描述以 facilitate 索引和检索仍大体保持手动过程。视频大语言模型 (VidLLM) 具有显著潜力自动化此任务,但在新闻领域尚缺乏全面评估。本工作提出一项比较性研究,评估八种最新开源 VidLLM 用于新闻视频自动标题生成,在两个互补的基准数据集上进行评估:一个来自智利电视新闻语料库(约 1,345 个片段)和一个来自 BBC News 的语料库(9,838 个片段)。我们采用词汇指标 (METEOR、ROUGE-L)、语义指标 (BERTScore、CLIPScore、Text Similarity、Mean Reciprocal Rank) 以及本工作提出的两种新颖保真度指标:主题保真度得分 (TFS) 和实体保真度得分 (EFS)。我们的分析表明,标准指标因依赖表面形式、静态帧不敏感以及功能词膨胀,在新闻视频标题生成中表现出有限的判别能力。TFS 和 EFS 通过直接评估生成标题中主题结构的保持情况和专有名词覆盖率,弥补了这些差距。结果显示,Gemma~3 在两个数据集以及大多数评估维度上实现最高的整体性能,Qwen-VL 则稳居第二。

关键词

引用

@article{arxiv.2603.27662,
  title  = {A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos},
  author = {David Miranda Paredes and Jose M. Saavedra and Marcelo Pizarro},
  journal= {arXiv preprint arXiv:2603.27662},
  year   = {2026}
}