中文

大型语言模型与多模态检索用于视觉词义消歧

计算与语言 2024-04-23 v1

摘要

视觉词义消歧(VWSD)是一项新颖且具挑战性的任务,目标是从一组候选图像中检索出能更好表示给定语境下歧义词含义的图像。本文通过应用一系列不同方法,朝揭示这一有趣任务迈出实质一步。由于 VWSD 本质上是一项文本-图像检索任务,我们探索了最新的基于 transformer 的多模态检索方法。此外,我们利用大型语言模型(LLM)作为知识库以增强给定短语并解决与目标词相关的歧义。我们还将 VWSD 作为单模态问题,转化为文本到文本与图像到图像检索以及问答(QA)来研究,以充分探索相关模型的能力。为挖掘 LLM 的隐式知识,我们尝试使用思维链(CoT)提示以引导可解释答案生成。在此基础上,我们训练了一个学习排序(LTR)模型以组合不同模块,取得具竞争力的排序结果。在 VWSD 上的大量实验提供了驱动未来方向的有效洞见。

关键词

引用

@article{arxiv.2310.14025,
  title  = {Large Language Models and Multimodal Retrieval for Visual Word Sense Disambiguation},
  author = {Anastasia Kritharoula and Maria Lymperaiou and Giorgos Stamou},
  journal= {arXiv preprint arXiv:2310.14025},
  year   = {2024}
}

备注

Conference on Empirical Methods in Natural Language Processing (EMNLP) 2023