MultiVENT 2.0: 面向事件中心视频检索的大规模多语言基准
计算机视觉与模式识别
2025-02-11 v2 计算与语言
摘要
从大规模多模态集合中高效检索和综合信息已成为一个关键挑战。然而,现有的视频检索数据集存在范围限制,主要侧重于将描述性但模糊的查询与少量经过专业编辑、以英语为中心的视频集合进行匹配。为了解决这一差距,我们引入了,一个大规模、多语言、事件中心的视频检索基准,包含超过218,000个新闻视频和3,906个针对特定世界事件的查询。这些查询专门针对视频的视觉内容、音频、嵌入文本和文本元数据中的信息,要求系统利用所有这些来源才能成功完成任务。初步结果表明,最先进的视觉语言模型在此任务上表现挣扎,而尽管替代方法显示出前景,但仍不足以充分解决此问题。这些发现强调了需要更强大的多模态检索系统,因为有效的视频检索是实现多模态内容理解和生成的关键一步。
引用
@article{arxiv.2410.11619,
title = {MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval},
author = {Reno Kriz and Kate Sanders and David Etter and Kenton Murray and Cameron Carpenter and Kelly Van Ochten and Hannah Recknor and Jimena Guallar-Blasco and Alexander Martin and Ronald Colaianni and Nolan King and Eugene Yang and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2410.11619},
year = {2025}
}