VNU-Bench:面向多源多模态新闻视频理解的基准数据集
机器学习
2026-01-08 v1
摘要
新闻视频是精心编辑的多模态叙事,融合旁白、视觉元素和外部引语,构建连贯的叙事线索。近年来,针对新闻视频理解的人工智能模型取得了显著进展。然而,现有基准数据集主要聚焦于单源、视频内部推理,孤立处理每个报道。相比之下,现实中的新闻消费是多源的:同一事件由不同媒体以互补细节、不同的叙事选择以及时而矛盾的陈述进行报道。健全的新闻理解需要模型能够比较不同来源的视角,跨来源对齐多模态证据,并综合多源信息。为填补这一空白,我们提出 VNU-Bench,这是第一个面向新闻领域的多源、跨视频理解基准数据集。我们设计了一组独特的题目类型,专门测试模型理解多源多模态新闻的能力。我们提出一种新型的人类-模型混合 QA 生成流程,解决构建大规模跨来源新闻理解数据集在可扩展性和质量控制方面的问题。该数据集包含 429 组新闻、1,405 个视频和 2,501 份高质量问题。对闭源和开源多模态模型进行全面评估表明,VNU-Bench 对当前 MLLM 构成了实质性挑战。
引用
@article{arxiv.2601.03434,
title = {VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding},
author = {Zibo Liu and Muyang Li and Zhe Jiang and Shigang Chen},
journal= {arXiv preprint arXiv:2601.03434},
year = {2026}
}