Reward-RAG:通过奖励驱动监督增强检索增强生成
计算与语言
2024-10-08 v1 机器学习
摘要
本文介绍了 Reward-RAG,这是一种旨在通过奖励驱动监督来增强检索增强生成(RAG)模型的新方法。不同于以往的 RAG 方法专注于训练语言模型(LM)以利用来自外部来源检索的知识,本方法通过采用 CriticGPT 训练专门的奖励模型来适应特定领域的检索信息。该奖励模型生成合成数据集,用于微调 RAG 编码器,使其输出更贴近人类偏好。我们方法的灵活性使其能够通过领域特定的微调有效应用于 various 领域。我们在多个领域的公开基准上评估了 Reward-RAG,与最先进的方法进行比较。实验结果显示,Reward-RAG 在性能上显著提升,突显了其在提高生成响应相关性和质量方面的有效性。这些发现凸显了将奖励模型与 RAG 集成以实现更佳自然语言生成任务结果的潜力。
引用
@article{arxiv.2410.03780,
title = {Reward-RAG: Enhancing RAG with Reward Driven Supervision},
author = {Thang Nguyen and Peter Chin and Yu-Wing Tai},
journal= {arXiv preprint arXiv:2410.03780},
year = {2024}
}