中文

少样本域自适应的文本视觉融合事件检测

计算与语言 2023-06-06 v2 人工智能

摘要

将图像等辅助模态融入事件检测模型在过去几年中引起了越来越多的关注。自然语言在描述情境上的复杂性促使研究者利用相关的视觉上下文来提升事件检测性能。然而,该领域的现有方法受限于数据稀缺,需要大量标注的文本-图像对用于模型训练。此外,推理时视觉上下文的有限获取会对这类模型的性能产生负面影响,使其在实际场景中实质上无效。在本文中,我们提出了一种新颖的域自适应视觉融合事件检测方法,可在少量标注图像-文本配对数据点上训练。具体而言,我们引入了一种视觉生成器方法,在缺乏视觉上下文时从文本合成图像。此外,该生成器可针对特定域进行定制。由此,我们的模型能够利用预训练视觉-语言模型的能力,并可在少样本设定下训练。这也使得在仅提供单模态数据(即文本)时能有效推理。在基准 M2E2 数据集上的实验评估表明,我们的模型优于现有最先进模型,最高达 11 个点。

关键词

引用

@article{arxiv.2305.03517,
  title  = {Few-shot Domain-Adaptive Visually-fused Event Detection from Text},
  author = {Farhad Moghimifar and Fatemeh Shiri and Van Nguyen and Reza Haffari and Yuan-Fang Li},
  journal= {arXiv preprint arXiv:2305.03517},
  year   = {2023}
}