Abstain-R1:基于可验证强化学习的校准性放弃与后拒绝澄清
计算与语言
2026-04-21 v1 人工智能
摘要
强化微调可提升大语言模型的推理能力,但也可能鼓励模型在猜测或幻觉缺失信息时生成可回答查询的答案。现有的放弃方法要么训练模型生成通用拒绝,要么鼓励后续澄清,却未验证这些澄清是否识别了关键缺失信息。我们研究那些在意义上清晰却无法从给定信息可靠解决的查询,认为可靠模型不仅应放弃,还应解释其缺失之处。我们提出一种澄清感知的 RLVR奖励机制,在奖励可回答查询的正确答案的同时,联合优化不可回答查询上的显式放弃与语义对齐的后拒绝澄清。使用该奖励,我们训练了 Abstain-R1,一个 3B 参数模型,在保持强大的可回答查询性能的同时,显著提升了不可回答查询上的放弃与澄清能力。在 Abstain-Test、Abstain-QA 和 SelfAware 上的实验表明,Abstain-R1 在其基础模型之上取得显著提升,达到了包括 DeepSeek-R1 在内的更大规模系统相当的不可回答查询行为,表明通过可验证奖励而非仅靠规模即可学习校准性放弃与澄清。
引用
@article{arxiv.2604.17073,
title = {Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL},
author = {Skylar Zhai and Jingcheng Liang and Dongyeop Kang},
journal= {arXiv preprint arXiv:2604.17073},
year = {2026}
}
备注
Accepted at ACL 2026