中文

诚实优于准确:通过强化犹豫实现可信赖语言模型

机器学习 2025-11-25 v2

摘要

现代语言模型未能满足可信赖智能的基本要求:知道何时不回答。尽管在基准测试上取得了令人印象深刻的准确率,但这些模型仍会产生自信的错误答案,即使错误答案可能带来灾难性后果。我们在GSM8K、MedQA和GPQA上的评估表明,前沿模型几乎从不放弃回答,即使面临严重处罚的明确警告,这说明提示词无法覆盖那种奖励任何答案而非不回答的训练。作为补救措施,我们提出了强化犹豫(Reinforced Hesitation, RH):对可验证奖励强化学习(RLVR)的修改,使用三元奖励(+1正确,0放弃回答,-λ\lambda错误)而非二元奖励。在逻辑谜题上的受控实验表明,改变λ\lambda会在帕累托前沿上产生不同的模型,其中每个训练惩罚为其对应的风险区间产生最优模型:低惩罚产生积极回答者,高惩罚产生保守放弃者。随后我们引入两种利用训练好的放弃回答作为协调信号的推理策略:级联路由通过风险容忍度递减的模型传递查询,而自级联在放弃回答时重新查询同一模型。两者均以更低的计算成本优于多数投票。这些结果将放弃回答确立为一流的训练目标,将"我不知道"从失败转化为协调信号,使模型能够通过对其局限性的校准式诚实来赢得信任。

关键词

引用

@article{arxiv.2511.11500,
  title  = {Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation},
  author = {Mohamad Amin Mohamadi and Tianhao Wang and Zhiyuan Li},
  journal= {arXiv preprint arXiv:2511.11500},
  year   = {2025}
}