通过强化学习教会语言模型进行评判
机器学习
2025-12-02 v2 人工智能
计算与语言
摘要
教会大型语言模型(LLMs)评判和改进其输出,对于构建能够迭代优化的系统至关重要,但这从根本上受限于提供准确判断和可操作建议的能力。在这项工作中,我们研究了用于代码生成的 LLM 评判模型,并提出了 CTRL,一个通过强化学习训练评判模型的框架,该框架训练一个评判模型来生成反馈,以在无人工监督的情况下最大化固定生成器模型的修正性能。我们的结果表明,使用 CTRL 训练的评判模型显著提高了基础生成器模型和更强生成器模型的通过率,并减轻了复合错误。此外,我们表明这些评判模型可作为准确的生成式奖励模型,并通过迭代的评判-修正实现测试时扩展,在具有挑战性的代码生成基准测试中实现了高达 106.1% 的相对改进。
引用
@article{arxiv.2502.03492,
title = {Teaching Language Models to Critique via Reinforcement Learning},
author = {Zhihui Xie and Jie Chen and Liyu Chen and Weichao Mao and Jingjing Xu and Lingpeng Kong},
journal= {arXiv preprint arXiv:2502.03492},
year = {2025}
}