基于细粒度知识反馈的策略自对齐:针对幻觉缓解
计算与语言
2025-05-27 v6
摘要
幻觉现象发生于大型语言模型在生成响应时表现出偏离其知识边界的行为。为解决此关键问题,先前的基于学习的方法尝试微调模型,但受限于离策略抽样和粗粒度反馈。本文提出 \textit{\b{R}einforcement \b{L}earning \b{f}or \b{H}allucination} (RLFH),一种基于策略的自对齐方法,使 LLM 能够主动探索其知识边界,通过细粒度反馈信号自我纠正生成行为。RLFH 引入自评估框架,其中策略作为自身裁判。通过该框架,对响应自动分解为原子事实,并针对外部知识来源评估其真实性和信息性。 resulting fine-grained feedback 在句子层面随后被转换为 token 级别的稠密奖励信号。这使得在线强化学习能够实现精确且及时的优化,无需人工干预。在 HotpotQA、SQuADv2 和 Biography 等基准上进行的全面评估验证了 RLFH 在幻觉缓解方面的有效性。
引用
@article{arxiv.2406.12221,
title = {On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation},
author = {Xueru Wen and Jie Lou and Xinyu Lu and Ji Yuqiu and Xinyan Guan and Yaojie Lu and Hongyu Lin and Ben He and Xianpei Han and Debing Zhang and Le Sun},
journal= {arXiv preprint arXiv:2406.12221},
year = {2025}
}
备注
Accepted as ACL 2025 Findings