中文

MultiVENT:带有对齐自然文本的多语言事件视频数据集

信息检索 2023-07-07 v1 计算机视觉与模式识别 多媒体

摘要

日常新闻覆盖已从传统广播转向包括一手未剪辑视频素材在内的多种呈现形式。反映线上可得的多样化多模态、多语言新闻来源的数据集可用于教导模型从这一转变中获益,但现有新闻视频数据集聚焦于为英语受众制作的传统新闻广播。我们构建 MultiVENT 这一以事件为中心、跨五种目标语言并基于文本文档对齐的多语言视频数据集,以弥补上述局限。MultiVENT 同时包含新闻广播视频与非专业事件 footage,我们借此分析在线新闻视频现状及其如何被用于构建稳健、事实准确的模型。最后,我们给出一个面向复杂多语言视频检索的模型,作为使用 MultiVENT 进行信息检索的基线。

关键词

引用

@article{arxiv.2307.03153,
  title  = {MultiVENT: Multilingual Videos of Events with Aligned Natural Text},
  author = {Kate Sanders and David Etter and Reno Kriz and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2307.03153},
  year   = {2023}
}