中文

为何语义熵失效:基于几何感知的校准不确定性用于策略优化

机器学习 2026-05-22 v1 计算与语言

摘要

后训练已成为提高大语言模型推理与对齐的核心手段,其中无批评家模型的方法使可从模型生成输出中进行可扩展学习,但缺乏原则性机制以区分信息丰富与噪声信号。最近的研究方法利用响应级别的度量作为不确定性信号,以调节基于组的优化方法(如GRPO)。然而,其经验成功在如何影响优化动力学方面仍不稳定且不清晰。本文提供了据称首个原则性表述,将不确定性信号解释为描述和调节梯度方差及学习信号质量的机制。基于经验与理论分析,我们识别了当前熵基估计器的两个关键缺口:各向异性缺口与校准缺口。鼓励这一分析,我们提出了几何感知校准策略优化(GCPO),一种新型框架集成几何感知措施以捕捉语义不一致,结合基于奖励的校准以对齐不确定性与学习信号强度。实验在多个基准上表明,我们的方法更忠实地跟踪梯度可变性,持续改进后训练性能。我们的结果突显了设计与优化动力学对齐的不确定性信号的重要性,为稳健后训练提供了原则性视角。

关键词

引用

@article{arxiv.2605.21801,
  title  = {Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization},
  author = {Zheyuan Zhang and Kaiwen Shi and Han Bao and Zehong Wang and Tianyi Ma and Yanfang Ye},
  journal= {arXiv preprint arXiv:2605.21801},
  year   = {2026}
}