CoRe-MMRAG:面向多模态 RAG 的跨源知识协调
计算与语言
2025-06-06 v2 人工智能
信息检索
摘要
多模态检索增强生成(MMRAG)被引入以通过整合外部检索的多模态知识来增强多模态大语言模型,但它引入了两个挑战:参数-检索知识不一致(PRKI),即参数化知识与检索知识之间的差异在确定可靠性时产生不确定性;以及视觉-文本知识不一致(VTKI),即视觉与文本源之间的错位破坏了实体表示。为了应对这些挑战,我们提出了面向多模态 RAG 的跨源知识协调(CoRe-MMRAG),这是一种新颖的端到端框架,能有效协调跨知识源的不一致性。CoRe-MMRAG 遵循四阶段流水线:首先从参数化知识生成内部响应,然后通过联合相似度评估选择最相关的多模态证据,生成外部响应,最后将两者整合以产生可靠的答案。此外,一种专门的训练范式增强了知识源判别、多模态整合和统一的答案生成。在 KB-VQA 基准上的实验表明,CoRe-MMRAG 相较于基线方法取得了显著提升,在 InfoSeek 和 Encyclopedic-VQA 上分别实现了 5.6% 和 9.3% 的性能增益。
引用
@article{arxiv.2506.02544,
title = {CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG},
author = {Yang Tian and Fan Liu and Jingyuan Zhang and Victoria W. and Yupeng Hu and Liqiang Nie},
journal= {arXiv preprint arXiv:2506.02544},
year = {2025}
}
备注
Accepted to ACL 2025 Main