Windsock 正在舞动:自适应多模态检索增强生成
计算机视觉与模式识别
2025-10-28 v1 计算与语言
信息检索
摘要
多模态检索增强生成(MRAG)已成为通过整合来自外部知识库的非参数化知识来增强多模态大型语言模型(MLLM)生成事实和最新回应的有前景的方法。然而,现有的 MRAG 方法存在静态检索策略、模态选择不灵活以及对检索信息利用不充分的问题,导致三个关键挑战:何时检索、采用何种模态以及如何有效利用检索信息。为此,我们提出 Windsock,一个查询依赖的模块,对检索必要性和模态选择作出决策,有效降低计算开销并提高回应质量。此外,我们提出动态噪声抵抗(DANCE)指令微调,是一种自适应训练策略,增强 MLLM 利用检索信息的能力,同时保持对噪声的鲁健性。我们采用自评估方法,利用 MLLM 中的知识将问答数据集转换为 MRAG 训练数据集。广泛的实验表明,我们的方法通过 17.07% 的显著提升生成质量,同时降低 8.95% 的检索次数。
引用
@article{arxiv.2510.22694,
title = {Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation},
author = {Shu Zhao and Tianyi Shen and Nilesh Ahuja and Omesh Tickoo and Vijaykrishnan Narayanan},
journal= {arXiv preprint arXiv:2510.22694},
year = {2025}
}
备注
Accepted at NeurIPS 2025 UniReps Workshop