仅最大化置信度即可提升推理能力
机器学习
2025-06-30 v4 人工智能
摘要
强化学习 (RL) 使机器学习模型在许多领域取得了显著进展。最近,RL 赋能前沿语言模型解决具有挑战性的数学、科学和编程问题。然而,任何 RL 算法的核心都是奖励函数,而奖励工程在所有领域都是一个公认的难题。在本文中,我们提出 RENT:基于熵最小化的强化学习——一种完全无监督的 RL 方法,无需外部奖励或真实答案,而是使用模型其底层分布的熵作为内在奖励。我们发现,通过强化在生成答案上产生高模型置信度的思维链,模型能够提升其推理能力。在我们的实验中,我们在包括 GSM8K、MATH500、AMC、AIME 和 GPQA 在内的广泛常用推理基准上,以及来自 Qwen、Mistral 和 Llama 家族的不同规模模型上展示了这些改进。我们无监督学习方法的通用性使其适用于外部监督不可用的一系列广泛领域。
引用
@article{arxiv.2505.22660,
title = {Maximizing Confidence Alone Improves Reasoning},
author = {Mihir Prabhudesai and Lili Chen and Alex Ippoliti and Katerina Fragkiadaki and Hao Liu and Deepak Pathak},
journal= {arXiv preprint arXiv:2505.22660},
year = {2025}
}
备注
Website: https://rent-rl.github.io/