中文

OpenEvents V1:多模态事件 grounding 的大规模基准数据集

计算机视觉与模式识别 2025-08-27 v2

摘要

我们介绍了 OpenEvents V1a 大规模基准数据集,旨�推动以事件为中心的视觉语言理解。不同于关注表面级描述的常规图像标题和检索数据集,OpenEvents V1 数据集强调通过三项主要任务实现上下文和时间 grounding:(1)生成富有事件导向性的图像标题,(2)从图像查询中检索与事件相关的新闻文章,(3)从叙事式文本查询中检索事件相关的图像。该数据集包含来自 CNN 和 The Guardian 的 20 万+篇新闻文章和 40 万+张关联图像,涵盖多样领域和时间段。我们提供了详尽的基线结果和标准化评估协议,适用于所有任务。OpenEvents V1 为开发能够对复杂真实事件进行深层推理的多模态 AI 系统奠定了稳健基础。数据集已公开:https://ltnghia.github.io/eventa/openevents-v1。

关键词

引用

@article{arxiv.2506.18372,
  title  = {OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding},
  author = {Hieu Nguyen and Phuc-Tan Nguyen and Thien-Phuc Tran and Minh-Quang Nguyen and Tam V. Nguyen and Minh-Triet Tran and Trung-Nghia Le},
  journal= {arXiv preprint arXiv:2506.18372},
  year   = {2025}
}

备注

ACM Multimedia 2025