Collab-RAG:通过白盒和黑盒LLM协作提升检索增强生成用于复杂问答
计算与语言
2025-04-08 v1 人工智能
信息检索
机器学习
摘要
检索增强生成(RAG)系统常常因检索不到相关上下文以及有限的复杂推理能力而难以准确处理多跳问答任务。我们引入Collab-RAG,一种协作式训练框架,利用白盒小型语言模型(SLM)和黑盒大型语言模型(LLM)之间的相互增强来提升RAG。具体而言,SLM将复杂查询分解为更简单的子问题,从而提高检索准确性,并促进黑盒LLM进行更有效的推理。同时,黑盒LLM提供反馈信号来提高SLM的分解能力。我们观察到Collab-RAG仅依赖于来自可负担的黑盒LLM的监督,而无需来自前沿LLM的额外蒸馏,却在多个黑盒LLM上表现出强大的泛化能力。跨越五个多跳问答数据集的实验评估表明,Collab-RAG在平均性能上显著优于现有的黑盒-only和SLM微调基线,提升幅度为1.8%-14.2%。特别是,我们的微调3B SLM在问题分解方面超越了冻结的32B LLM,凸显了Collab-RAG在提高复杂问题的推理和检索方面的效率。Collab-RAG的代码已发布于https://github.com/ritaranx/Collab-RAG/。
引用
@article{arxiv.2504.04915,
title = {Collab-RAG: Boosting Retrieval-Augmented Generation for Complex Question Answering via White-Box and Black-Box LLM Collaboration},
author = {Ran Xu and Wenqi Shi and Yuchen Zhuang and Yue Yu and Joyce C. Ho and Haoyu Wang and Carl Yang},
journal= {arXiv preprint arXiv:2504.04915},
year = {2025}
}
备注
Work in progress. Code: https://github.com/ritaranx/Collab-RAG/