中文

面向多模态关系抽取的变分多模态超图注意力网络

计算与语言 2024-04-19 v1

摘要

多模态关系抽取(MMRE)旨在利用图像信息从文本中识别实体之间的关系,这是一个具有挑战性的任务。现有方法受限于忽视同一句子中多个实体对共享极其相似的上下文信息(即相同的文本和图像),导致 MMRE 任务的难度增加。为解决这一局限性,我们提出了变分多模态超图注意力网络(VM-HAN)用于多模态关系抽取。具体而言,我们首先为每个句子及其对应的图像构建多模态超图,以建立不同实体对在每个句子中不同层次的内/模关联。我们进一步设计了变分超图注意力网络(V-HAN),以高斯分布获取不同实体对的表征多样性,并通过变分注意力学习更好的超图结构。VM-HAN 在多模态关系抽取任务上实现了最先进的性能,相较于现有方法在准确率和效率方面均表现出色。

关键词

引用

@article{arxiv.2404.12006,
  title  = {Variational Multi-Modal Hypergraph Attention Network for Multi-Modal Relation Extraction},
  author = {Qian Li and Cheng Ji and Shu Guo and Yong Zhao and Qianren Mao and Shangguang Wang and Yuntao Wei and Jianxin Li},
  journal= {arXiv preprint arXiv:2404.12006},
  year   = {2024}
}