中文

面向基于知识的视觉问答的大语言模型模态感知融合

计算机视觉与模式识别 2024-03-05 v2 人工智能 计算与语言 信息检索 机器学习

摘要

基于知识的视觉问答(KVQA)已被广泛研究,旨在利用外部知识(如知识图谱 KGs)回答视觉问题。虽然已有若干尝试利用大语言模型(LLMs)作为隐式知识源,但由于 LLMs 可能产生幻觉,这仍然具有挑战性。此外,在复杂场景中,图像、KGs 和 LLMs 等多种知识源难以直接对齐。为解决这些问题,我们提出了一种用于 KVQA 的 novel 模态感知 LLM 融合方法(MAIL)。该方法仔细利用多模态知识进行图像理解和知识推理。具体而言:(i) 我们提出了一种基于 LLM 的两阶段提示策略,将图像密集地体现为具有详细视觉特征的场景图;(ii) 通过将提及的实体与外部事实链接,构建耦合概念图;(iii) 设计了定制的伪孪生图中介融合以实现充分的多模态融合。我们利用两个图中共享的提及实体作为中介,桥接紧密的模态间交换,同时通过将融合限制在中介内,最大限度地保留有洞察力的模态内学习。在两个基准数据集上的大量实验表明,MAIL 在减少 24 倍资源的情况下表现出优越性。

关键词

引用

@article{arxiv.2402.12728,
  title  = {Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering},
  author = {Junnan Dong and Qinggang Zhang and Huachi Zhou and Daochen Zha and Pai Zheng and Xiao Huang},
  journal= {arXiv preprint arXiv:2402.12728},
  year   = {2024}
}

备注

8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale