$M^3EL$:面向多模态实体链接的多任务多主题数据集
信息检索
2024-10-25 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
多模态实体链接(MEL)是多种下游任务的基础组件。然而,现有的MEL数据集存在规模小、主题类型稀缺和任务覆盖有限的问题,无法有效增强多模态模型的实体链接能力。为解决这些障碍,我们提出了一种数据集构建流程,并发布了,一个大规模MEL数据集。包含79,625个实例,涵盖9种不同的多模态任务和5个不同的主题。此外,为进一步提高模型对多模态任务的适应性,我们提出了一种模态增强训练策略。利用作为语料库,训练基于的模型,并与现有的多模态基线进行比较分析。实验结果表明,现有模型的表现远低于预期(准确率为49.4%-75.8%)。分析发现,数据集规模小、模态任务覆盖不足以及主题多样性有限导致多模态模型泛化能力差。我们的数据集有效解决了这些问题,使用微调的模型在准确率上显示出显著提升,各项任务平均提升9.3%至25%。我们的数据集可在https://anonymous.4open.science/r/M3EL获取。
引用
@article{arxiv.2410.18096,
title = {$M^3EL$: A Multi-task Multi-topic Dataset for Multi-modal Entity Linking},
author = {Fang Wang and Shenglin Yin and Xiaoying Bai and Minghao Hu and Tianwei Yan and Yi Liang},
journal= {arXiv preprint arXiv:2410.18096},
year = {2024}
}