KnowRL:探索基于知识的强化学习以实现事实性
人工智能
2026-04-17 v4 计算与语言
计算机视觉与模式识别
机器学习
多智能体系统
摘要
大语言模型(LLM),尤其是慢思考模型,常常表现出严重的幻觉,由于在推理过程中无法准确识别知识边界而输出错误内容。虽然强化学习(RL)可以增强复杂的推理能力,但其面向结果的奖励机制通常缺乏对思考过程的事实性监督,进一步加剧了幻觉问题。为了解决慢思考模型中的高幻觉问题,我们提出了知识增强的强化学习KnowRL。KnowRL通过将基于知识验证的事实性奖励整合到RL训练过程中,引导模型进行基于事实的慢思考,帮助它们识别自身的知识边界。这种在RL训练期间有针对性的事实输入使模型能够学习并内化基于事实的推理策略。通过直接奖励推理步骤中对事实的遵循,KnowRL培养了一个更可靠的思考过程。在三个幻觉评估数据集和两个推理评估数据集上的实验结果表明,KnowRL有效缓解了慢思考模型中的幻觉,同时保持了其原有的强大推理能力。我们的代码可在https://github.com/zjunlp/KnowRL获取。
引用
@article{arxiv.2506.19807,
title = {KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality},
author = {Baochang Ren and Shuofei Qiao and Da Zheng and Huajun Chen and Ningyu Zhang},
journal= {arXiv preprint arXiv:2506.19807},
year = {2026}
}
备注
ACL 2026