强化微调的幻觉税
计算与语言
2025-05-21 v1
摘要
强化微调 (RFT) 已成为增强大型语言模型 (LLM) 推理能力的标准方法,但其对模型可信度的影响仍未得到充分探讨。本文我们识别并系统性地研究了 RFT 的一个关键副作用,即幻觉税:模型拒绝行为的退化导致模型对不可回答问题信心地生成幻觉答案。为调查此问题,我们引入 SUM (Synthetic Unanswerable Math),一个高质量的不可回答数学问题数据集,旨在探测模型通过对 insufficient 或 模糊信息进行推理来识别不可回答问题的能力。我们的结果表明,标准 RFT 训练可使模型拒绝率下降超过 80%,显著增加模型幻觉倾向。我们进一步演示,在 RFT 中仅包含 10% SUM 即可显著恢复适当的拒绝行为,同时在可解任务上几乎没有准确率损失。关键的是,这一方法使 LLM 能够利用推理时间计算来推理自身的不确定性和知识边界,从而提升不仅对域外数学问题的泛化能力,也提升事实性问题的回答能力。
引用
@article{arxiv.2505.13988,
title = {The Hallucination Tax of Reinforcement Finetuning},
author = {Linxin Song and Taiwei Shi and Jieyu Zhao},
journal= {arXiv preprint arXiv:2505.13988},
year = {2025}
}