基于查询的实体-对象变换器的多模态关系三元组提取
信息检索
2024-08-19 v1
摘要
多模态关系提取对于构建灵活且逼真的知识图谱至关重要。近期研究聚焦于从不同模态中提取关系类型,例如一个实体在文本中,另一个在图像中。然而,现有方法需要事先给定实体和对象,这在成本和实用性上都是负担。为解决这一局限,我们提出了一项新任务——多模态实体-对象关系三元组提取,旨在从图像-文本对中提取所有三元组(实体跨度、关系、对象区域)。为促进该研究,我们修改了一个多模态关系提取数据集MORE(包含21种关系类型),以创建一个包含20,264个三元组的新数据集,平均每对图像-文本包含5.75个三元组。此外,我们提出了QEOT,一种基于查询的模型,配备选择性注意力机制,以动态探索文本和视觉信息的交互与融合。特别是,所提出的方法可以同时完成实体提取、关系分类和目标检测,仅通过一组查询。我们的方法适用于下游应用,并减少了流水线式方法导致的错误累积。广泛的实验结果表明,我们提出的方法超越了现有基线8.06%,并取得了最先进性能。
引用
@article{arxiv.2408.08709,
title = {Multimodal Relational Triple Extraction with Query-based Entity Object Transformer},
author = {Lei Hei and Ning An and Tingjing Liao and Qi Ma and Jiaqi Wang and Feiliang Ren},
journal= {arXiv preprint arXiv:2408.08709},
year = {2024}
}
备注
15 pages, 7 figures, preprint