中文

CLIP-Event:利用事件结构连接文本与图像

计算机视觉与模式识别 2022-05-02 v2 人工智能

摘要

视觉-语言预训练模型通过理解图像与文本之间的对齐关系,在支持多媒体应用方面取得了巨大成功。虽然现有的视觉-语言预训练模型主要侧重于理解图像中的对象或文本中的实体,但它们往往忽略了事件层面及其论元结构的对齐。在本工作中,我们提出了一个对比学习框架,以促使视觉-语言预训练模型理解事件及相关的论元(参与者)角色。为实现这一目标,我们利用文本信息提取技术获取事件结构知识,并利用多种提示函数通过操纵事件结构来对比困难负样本描述。我们还设计了一种基于最优传输的事件图对齐损失,以捕捉事件论元结构。此外,我们收集了一个包含丰富事件的大规模数据集(106,875 张图像)用于预训练,这提供了一个更具挑战性的图像检索基准,以评估对复杂长句的理解。实验表明,我们的零样本 CLIP-Event 在 Multimedia Event Extraction 的论元提取上优于最先进的有监督模型,在事件提取上实现了超过 5% 的绝对 F 分数提升,并在零样本设置下的各种下游任务上取得了显著改进。

关键词

引用

@article{arxiv.2201.05078,
  title  = {CLIP-Event: Connecting Text and Images with Event Structures},
  author = {Manling Li and Ruochen Xu and Shuohang Wang and Luowei Zhou and Xudong Lin and Chenguang Zhu and Michael Zeng and Heng Ji and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2201.05078},
  year   = {2022}
}