MaFeRw:面向检索增强大语言模型的多方面反馈查询重写
计算与语言
2024-12-20 v2
摘要
在真实世界的 RAG 系统中,当前查询通常包含对话上下文中的口语省略和歧义指代,因此需要查询重写以更好地描述用户的信息需求。然而,传统的基于上下文的重写对下游生成任务的提升甚微,这是由于从查询重写到响应生成的过程过于冗长。一些研究人员尝试利用带有生成反馈的强化学习来辅助重写器,但在大多数情况下,这些稀疏奖励提供的指导很少,导致训练和生成结果不稳定。我们发现用户的需求也反映在黄金文档、检索到的文档和真实答案中。因此,通过将这些多方面的密集奖励反馈给查询重写,可以实现更稳定和令人满意的响应。在本文中,我们提出了一种新颖的查询重写方法 MaFeRw,该方法通过整合来自检索过程和生成结果的多方面反馈来提升 RAG 性能。具体而言,我们首先使用人工数据训练 T5 模型以进行重写器初始化。接下来,我们设计了三个指标作为强化学习反馈:重写查询与黄金文档之间的相似度、排序指标,以及生成结果与真实答案之间的 ROUGE。受 RLAIF 启发,我们针对上述指标训练了三种奖励模型以实现更高效的训练。最后,我们将这些奖励模型的分数结合作为反馈,并使用 PPO 算法探索最优查询重写策略。在两个对话式 RAG 数据集上的实验结果表明,与基线相比,MaFeRw 取得了更优的生成指标和更稳定的训练。
引用
@article{arxiv.2408.17072,
title = {MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language Models},
author = {Yujing Wang and Hainan Zhang and Liang Pang and Binghui Guo and Hongwei Zheng and Zhiming Zheng},
journal= {arXiv preprint arXiv:2408.17072},
year = {2024}
}