ComposeRAG:一种面向语料库奠基多跳问答的模块化可组合 RAG
计算与语言
2025-06-03 v1
摘要
检索增强生成 (RAG) 系统日益多样化,但许多系统受限于将查询重构、检索、推理和验证等核心功能紧密耦合的单体设计。这限制了它们的可解释性、系统评估和针对性改进,尤其是在复杂的多跳问答中。我们引入了 ComposeRAG,这是一种新颖的模块化抽象,将 RAG 流水线分解为原子化、可组合的模块。每个模块(如问题分解、查询重写、检索决策和答案验证)作为对结构化输入/输出的参数化变换,允许独立实现、升级和分析。为了增强对多步推理中错误的鲁棒性,ComposeRAG 结合了自我反思机制,在验证失败时迭代地重新审视并改进早期步骤。在四个具有挑战性的多跳问答基准上进行评估,ComposeRAG 在准确率和奠基保真度上始终优于强基线。具体而言,与基于微调的方法相比,其准确率提升高达 15%,在相同检索条件下,相比推理专用流水线提升高达 5%。至关重要的是,ComposeRAG 显著增强了奠基:其验证优先的设计在低质量检索设置中将无奠基答案减少了 10% 以上,即使在强语料库下也减少了约 3%。全面的消融研究验证了模块化架构,展示了每个组件的独立且可叠加的贡献。这些发现突显了 ComposeRAG 提供灵活、透明、可扩展且高性能的多跳推理的能力,同时改进了奠基和可解释性。
引用
@article{arxiv.2506.00232,
title = {ComposeRAG: A Modular and Composable RAG for Corpus-Grounded Multi-Hop Question Answering},
author = {Ruofan Wu and Youngwon Lee and Fan Shu and Danmei Xu and Seung-won Hwang and Zhewei Yao and Yuxiong He and Feng Yan},
journal= {arXiv preprint arXiv:2506.00232},
year = {2025}
}