中文

基于生成模型的多模态实体链接基准评测

计算与语言 2023-05-30 v1 人工智能

摘要

实体可用多种格式表达,如文本、图像或表格中的列名与单元格值。尽管现有实体链接(EL)模型在单一模态配置(如纯文本 EL、视觉定位或模式链接)下表现良好,设计统一模型处理多样模态配置更具挑战性。为汇聚各类模态配置,我们基于现有 EL 数据集构建了多模态 EL(DMEL)基准,涵盖文本、图像与表格全部三种模态。为处理 DMEL 任务,我们提出遵循多模态编码器-解码器范式的生成式多模态模型(GDMM)。以丰富语料预训练 \Model 为 DMEL 奠定基础,且推理时无需存储整个知识库。微调 GDMM 建立了更强的 DMEL 基线,平均以 8.51 F1 分数超越最先进的任务专用 EL 模型。此外,我们进行了详尽的错误分析以凸显 DMEL 的挑战,促进该任务的未来研究。

关键词

引用

@article{arxiv.2305.17337,
  title  = {Benchmarking Diverse-Modal Entity Linking with Generative Models},
  author = {Sijia Wang and Alexander Hanbo Li and Henry Zhu and Sheng Zhang and Chung-Wei Hang and Pramuditha Perera and Jie Ma and William Wang and Zhiguo Wang and Vittorio Castelli and Bing Xiang and Patrick Ng},
  journal= {arXiv preprint arXiv:2305.17337},
  year   = {2023}
}

备注

15 pages. ACL 2023