从视频和文章中联合提取多媒体事件
计算机视觉与模式识别
2021-09-28 v1 多媒体
摘要
视觉和文本模态提供了关于多媒体文档中描述的事件的互补信息。视频包含丰富的动态和事件的详细展开,而文本描述更高层次和抽象的概念。然而,现有的事件提取方法要么不处理视频,要么仅针对视频而忽略其他模态。相比之下,我们提出了首个从视频和文本文章中联合提取事件的方法。我们引入了视频多媒体事件提取(Video M2E2)这一新任务,并提出了两个新颖的组件来构建面向该任务的首个系统。首先,我们提出了首个自监督多模态事件共指模型,该模型能够在没有任何人工标注对的情况下确定视频事件与文本事件之间的共指关系。其次,我们引入了首个多模态Transformer,它能够从视频和文本文档中联合提取结构化事件信息。我们还构建并将公开发布一个新的视频-文章对基准数据集,该数据集包含860个视频-文章对,并带有用于评估该任务方法的广泛标注。我们的实验结果证明了所提方法在我们新基准数据集上的有效性。我们在多模态事件共指消解和多媒体事件提取上分别取得了6.0%和5.8%的绝对F-score提升。
引用
@article{arxiv.2109.12776,
title = {Joint Multimedia Event Extraction from Video and Article},
author = {Brian Chen and Xudong Lin and Christopher Thomas and Manling Li and Shoya Yoshida and Lovish Chum and Heng Ji and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2109.12776},
year = {2021}
}
备注
To be presented at EMNLP 2021 findings