中文

面向长文本检索增强生成的强化信息量优化

计算与语言 2026-05-08 v2

摘要

长文本问答(LFQA)需要开放式的长文本回复,以从多源证据中合成连贯且基于事实的内容。这使得强化学习(RL)的奖励设计至关重要。奖励必须可验证以实现忠实的依据和稳定的优化。然而,许多标准奖励假设存在唯一目标并采用精确匹配的正确性概念,这适用于短文本问答和数学问题,但在 LFQA 中失效。因此,当前的 RAG 系统仍缺乏可验证的奖励机制,导致反馈信号不稳定和优化结果次优。我们提出了 RioRAG,一个强化可验证信息量优化框架。首先,它将信息量定义为 RL 的一个可测量且外部可验证的目标。其次,RioRAG 使用以要点为中心的验证与跨源检查,使小型 LLM 能够自我演化,并提供更密集、具动作区分度的奖励,以缓解奖励稀疏性并稳定优化。该公式化方法避免了对策略模型的人工监督和强教师模型蒸馏,而是依赖外部可验证的反馈。在 LongFact 和 RAGChecker 上的实验表明,RioRAG 实现了更高的事实召回率和忠实度,确立了可验证奖励建模作为可信长文本 RAG 的基础。我们的代码可在 https://github.com/RUCAIBox/RioRAG 获取。

关键词

引用

@article{arxiv.2505.20825,
  title  = {Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation},
  author = {Yuhao Wang and Ruiyang Ren and Yucheng Wang and Wayne Xin Zhao and Jing Liu and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2505.20825},
  year   = {2026}
}