中文

基于 Jaccard 距离的条件对比学习与上下文视觉增强提升多模态实体链接

计算机视觉与模式识别 2025-01-27 v1 人工智能

摘要

先前的多模态实体链接(MEL)研究主要采用对比学习作为主要目标。然而,使用不加考虑地将其它 batch 用作负样本,这些研究风险在于利用容易的特征,可能忽略使实体独特的关键细节。在本工作中,我们提出了 JD-CCL,即 Jaccard 距离条件对比学习,旨在增强多模态实体链接模型的匹配能力。JD-CCL 利用元信息选择具有相似属性的负样本,使链接任务更具挑战性和鲁棒性。此外,为了解决视觉模态在提及物和实体之间差异所致的局限性,我们引入了一种新方法,CVaCPT(Contextual Visual-aid Controllable Patch Transform),通过纳入多视图合成图像和上下文文本表示来增强视觉表示,实现对 patch 表示的比例和偏移。在基准 MEL 数据集上的实验结果表明,我们的方法具有显著的有效性。

关键词

引用

@article{arxiv.2501.14166,
  title  = {Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual Augmentation},
  author = {Cong-Duy Nguyen and Xiaobao Wu and Thong Nguyen and Shuai Zhao and Khoi Le and Viet-Anh Nguyen and Feng Yichao and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2501.14166},
  year   = {2025}
}