受效用启发的奖励变换改善语言模型的强化学习训练
机器学习
2025-02-26 v2 人工智能
计算与语言
综合经济学
经济学
摘要
当前使用强化学习反馈训练大型语言模型(LLM)的方法,在训练时通常对多个奖励函数的输出进行平均。这忽略了单个奖励维度和奖励间依赖关系的关键方面,可能导致生成结果次优。在这项工作中,我们展示了奖励的线性聚合存在一些脆弱性,可能导致生成文本的不良属性。然后,我们提出了一种受经济学效用函数理论(特别是Inada条件)启发的奖励函数变换,该变换增强了对低奖励值的敏感性,同时降低了对高奖励值的敏感性。我们将我们的方法与现有的线性聚合奖励的基线方法进行比较,并展示了受Inada启发的奖励反馈优于传统的加权平均。我们定量和定性地分析了这些方法的差异,并发现使用Inada变换训练的模型在更有帮助的同时,危害性更小。
引用
@article{arxiv.2501.06248,
title = {Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models},
author = {Roberto-Rafael Maura-Rivero and Chirag Nagpal and Roma Patel and Francesco Visin},
journal= {arXiv preprint arXiv:2501.06248},
year = {2025}
}