超越数学与代码的可验证奖励:基于语料库的轻量级语料库 grounding 过程监督用于事实性问答
计算与语言
2026-05-29 v1
摘要
将强化学习应用于改进知识密集型问答中事实准确性面临奖励设计困境。响应级别的奖励仅提供粗糙的监督,无法区分推理痕迹中正确与错误的陈述。句子级别的替代方案提供更细粒度的反馈,但通常依赖 NLI 验证器、LLM 判官或知识验证管道,在规模化 RL 部署时昂贵且常常不可靠,尤其是对于稀有实体事实,此时需要准确的奖励信号。我们提出了 CorVer(Corpus Verify),一种轻量级、即插即用的过程奖励,将神经验证器替换为从维基百科共现统计中派生的语料库基准信号。CorVer 为每个句子分配句子级别的信用,并通过简单的对齐将其映射到 token 级别的优势,仅需 0.5B 的抽取器和每个句子一次语料库查找。在跨 30 个(模型、基准)单元格的测试中,涵盖 6 个指令调优模型(3B 到 14B)和 5 个 QA 基准,CorVer 在每个单元格中都优于原始基线,平均 TriviaQA 提升 +4.1 百分点。在可行配置下,CorVer 在 18 个中的 20 个单元格中超过四个神经验证器基线,同时训练速度快 4.8 至 8.4 倍。
引用
@article{arxiv.2605.29648,
title = {Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering},
author = {Shicheng Fan and Haochang Hao and Dehai Min and Weihao Liu and Philip S. Yu and Lu Cheng},
journal= {arXiv preprint arXiv:2605.29648},
year = {2026}
}