中文

基于贝叶斯集成的检索增强生成框架用于知识型视觉问答

计算与语言 2026-04-27 v1

摘要

检索增强生成(RAG)的常见做法是将文档拼接为单个上下文并传递给语言模型以生成答案。虽然简单直接,但这种策略会遮蔽单个文档的贡献,使归因困难,并导致“失于中间”效应,即长上下文中相关信息被忽视。拼接方式在扩展性方面也表现不佳:随着上下文长度增加,计算成本呈二次增长,这在上下文包含视觉数据(如视觉问答)时尤为严重。试图通过限制上下文长度来缓解此问题,反而会进一步限制性能,阻止模型从更深入的检索所能提供的更佳召回率中获益。我们提出贝叶斯集成检索增强生成(BERAG),以及贝叶斯集成微调(BEFT),作为一种RAG框架,其中语言模型被条件化于单个检索文档,而非单个组合上下文。BERAG将文档后验概率视为集成权重,并在生成期间按令牌更新。这种方法实现了概率重新排序、并行记忆使用以及文档贡献的清晰归因,特别适用于大型文档集合。我们主要在知识型视觉问答任务上评估BERAG和BEFT,其中模型必须在长且不完美的检索列表中进行推理。结果显示,与标准RAG相比,BERAG在Document视觉问答和多模态针对haystack的基准测试中实现了显著提升。我们还演示了BERAG缓解了“失于中间”效应。文档后验可用于检测 grounding不足并触发偏转,而文档修剪则比标准RAG实现更快的解码速度。

关键词

引用

@article{arxiv.2604.22678,
  title  = {BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering},
  author = {Jinghong Chen and Jingbiao Mei and Guangyu Yang and Bill Byrne},
  journal= {arXiv preprint arXiv:2604.22678},
  year   = {2026}
}