中文

少量近似,更多信息:基于混合后训练的性能与置信忠诚度和谐

机器学习 2026-04-10 v1

摘要

大型语言模型正在被部署到高风险任务中,其中自信而错误的推断可能导致严重的现实世界危害,这使之前被忽视的置信忠诚问题重新引起关注。一个有前景的解决方案是联合优化基于内部反馈的无监督强化学习 (RLIF) 与推理痕迹引导的推理蒸馏 (RD),但这面临三个持续的挑战:高质量训练语料的稀缺、事实不合理的过度自信以及不成比例的融合放大了错误更新。受人类从不确定性到确定性 confidence 积累的启发,我们提出渐进推理收益 (PRG) 来衡量推理步骤是否逐步加强对最终答案的支持。此外,我们引入 HyTuning,一种混合后训练框架,通过 PRG 风格的指标自适应地重新加权 RD 和 RLIF,使用稀缺的监督推理痕迹作为稳定锚点,同时利用丰富的无标签查询实现可扩展性。在几个领域特定和通用基准上进行的实验表明,HyTuning 在有限监督下提高了准确率,同时实现了置信忠诚度,支持“少量近似,更多信息”效应。

关键词

引用

@article{arxiv.2604.08454,
  title  = {Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks},
  author = {Haokai Ma and Lee Yan Zhen and Gang Yang and Yunshan Ma and Ee-Chien Chang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2604.08454},
  year   = {2026}
}