超越定位:跨模态提取细粒度事件层级
计算机视觉与模式识别
2023-12-21 v3 计算与语言
摘要
事件描述了我们世界中具有重要意义的发生。自然地,理解多媒体内容中提到的事件及其相互关系,构成了我们认识世界的重要方式。现有文献可以推断文本与视觉(视频)域中的事件是否相同(通过定位),从而处于同一语义层级。然而,定位未能捕捉由于同一事件在多个语义层级被提及而存在的复杂跨事件关系。例如,在图 1 中,“战争”这一抽象事件通过子事件“坦克开火”(视频中)和飞机“被击落”(文本中)在较低语义层级显现,从而在这些事件间形成层级化的多模态关系。在本文中,我们提出从多模态(视频与文本)数据中提取事件层级的任务,以捕捉同一事件如何在不同模态、不同语义层级上显现。这揭示了事件的结构,对理解事件至关重要。为支持该任务的研究,我们引入了多模态层级事件(MultiHiEve)数据集。与先前的视频-语言数据集不同,MultiHiEve 由新闻视频-文章对组成,因而富含事件层级。我们对数据集的一部分进行了密集标注以构建测试基准。我们展示了 SOTA 单模态与多模态基线在该任务上的局限性。进一步地,我们通过一个新的弱监督模型解决了这些局限,仅利用 MultiHiEve 中未标注的视频-文章对。我们对所提方法进行了 thorough 评估,证明了其在该任务上性能的提升,并指出了未来研究的机会。
引用
@article{arxiv.2206.07207,
title = {Beyond Grounding: Extracting Fine-Grained Event Hierarchies Across Modalities},
author = {Hammad A. Ayyubi and Christopher Thomas and Lovish Chum and Rahul Lokesh and Long Chen and Yulei Niu and Xudong Lin and Xuande Feng and Jaywon Koo and Sounak Ray and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2206.07207},
year = {2023}
}
备注
AAAI 2024