面向无监督多模态实体链接的多视角证据合成与推理
计算与语言
2026-04-23 v1
摘要
多模态实体链接(MEL)是数据管理中的一项基础任务,它将具有多种模态的歧义提及映射到知识库中的多模态实体。然而,现有的大多数MEL方法主要侧重于优化实例中心特征和证据,对更广泛形式的证据及其复杂的相互依赖关系探索不足。受人类专家决策过程依赖于多视角判断这一观察的启发,本工作提出了MSR-MEL,一个基于大型语言模型(LLM)的面向无监督MEL的多视角证据合成与推理框架。具体而言,我们采用了一个两阶段框架:(1)离线多视角证据合成构建了一个全面的证据集。这包括捕获提及和实体实例中心多模态信息的实例中心证据、聚合邻域信息的群体级证据、基于字符串重叠率的词汇证据,以及基于简单汇总统计的统计证据。我们框架的一个核心贡献是群体级证据的合成,它通过图有效地聚合了关键的邻域信息。我们首先构建了LLM增强的上下文图。随后,通过非对称师生图神经网络对不同模态进行联合对齐。(2)在线多视角证据推理利用LLM作为推理模块,分析多视角证据的相关性和语义,从而诱导出一种有效的排序策略,实现无需监督的准确实体链接。在广泛使用的MEL基准上的大量实验表明,MSR-MEL始终优于最先进的无监督方法。本文源代码已发布于:https://anonymous.4open.science/r/MSR-MEL-C21E/。
引用
@article{arxiv.2604.20283,
title = {Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking},
author = {Mo Zhou and Jianwei Wang and Kai Wang and Helen Paik and Ying Zhang and Wenjie Zhang},
journal= {arXiv preprint arXiv:2604.20283},
year = {2026}
}