中文

AMELI:利用细粒度属性增强多模态实体链接

计算与语言 2025-06-12 v2

摘要

我们提出属性感知的多模态实体链接,其输入由一段文本段落和图像描述的提及(mention)组成,目标是从多模态知识库(KB)中预测对应的目标实体,其中每个实体同样配有文本描述、视觉图像以及以结构化形式呈现实体元信息的属性集合。为推动该研究,我们构建了AMELI,包含一个全新的多模态实体链接基准数据集(含16,735个由文本描述并关联30,472张图像的提及)以及一个覆盖34,690个实体、177,873张实体图像和798,216条属性的多模态知识库。为在AMELI上建立基线性能,我们试验了几种最先进的多模态实体链接架构,并进一步提出一种将实体属性融入消歧的新方法。实验结果和大量定性分析表明,从提及的文本描述和视觉图像中提取并理解属性在多模态实体链接中起着至关重要的作用。据我们所知,我们是首个将属性整合进多模态实体链接任务的工作。程序、模型检查点和数据集公开于https://github.com/VT-NLP/Ameli。

关键词

引用

@article{arxiv.2305.14725,
  title  = {AMELI: Enhancing Multimodal Entity Linking with Fine-Grained Attributes},
  author = {Barry Menglong Yao and Sijia Wang and Yu Chen and Qifan Wang and Minqian Liu and Zhiyang Xu and Licheng Yu and Lifu Huang},
  journal= {arXiv preprint arXiv:2305.14725},
  year   = {2025}
}

备注

19 pages, 7 figures