多层混合专家模型用于多模态实体链接
计算机视觉与模式识别
2025-07-11 v1 人工智能
计算与语言
机器学习
多媒体
摘要
多模态实体链接(MEL)旨在将包含歧义指涉的文本上下文中的提及链接到多模态知识库中的关联实体。现有MEL方法引入多模态交互和融合机制以弥合模态差距并实现多粒度语义匹配。然而,这些方法并未解决两个重要问题:(i)指涉歧义,即因提及文本上下文的简短性和关键信息缺失导致的语义内容不足;(ii)模态内容的动态选择,即动态区分不同模态信息部分的重要性。为缓解这些问题,我们提出了用于MEL的多层混合专家模型(MMoE)。MMoE包含四个组件:(i)描述感知的提及增强模块利用大型语言模型识别最匹配提及的WikiData描述,考虑提及的文本上下文;(ii)多模态特征提取模块采用多模态特征编码器获取提及和实体的文本和视觉嵌入;(iii)-(iv)内部层混合专家和外部层混合专家模块应用开关混合专家机制动态自适应选择来自相关信息区域的特征。大量实验表明,MMoE在与最新方法的比较中表现卓越。MMoE的代码可在:https://github.com/zhiweihu1103/MEL-MMoE获得。
引用
@article{arxiv.2507.07108,
title = {Multi-level Mixture of Experts for Multimodal Entity Linking},
author = {Zhiwei Hu and Víctor Gutiérrez-Basulto and Zhiliang Xiang and Ru Li and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2507.07108},
year = {2025}
}
备注
Accepted at KDD 2025