中文

通过细粒度语义置信奖励训练 LLM 以 abstain

计算与语言 2025-10-29 v1 人工智能

摘要

缓解大型语言模型 (LLM) 中的幻觉现象对于其可靠部署至关重要。现有方法通常通过 fine-tune LLM 以 abstain 来回答超出其知识范围的问题。然而,这些方法常依赖粗糙信号来指导 LLM abstain,例如对多个采样答案的整体置信度或不确定性评分,可能导致模型对自身知识边界的感知不够精确。为此,我们提出了一种基于细粒度语义置信奖励 (FiSC) 的新型强化学习框架,以样本特定的置信度指导 LLM abstain。具体而言,我们的方法通过采样多个候选答案并进行语义聚类,然后训练 LLM 保留高置信度簇中的答案,丢弃低置信度簇中的答案,从而促进准确的事后 abstain。此外,我们提出了一种更全面评估 abstain fine-tune 任务可靠性的新指标。我们的方法在 both in-domain 和 out-of-distribution benchmark 中显著提升了可靠性。

关键词

引用

@article{arxiv.2510.24020,
  title  = {Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward},
  author = {Hao An and Yang Xu},
  journal= {arXiv preprint arXiv:2510.24020},
  year   = {2025}
}

备注

23pages, 4figures