中文

从奖励设计视角看大语言模型对齐进展综述

计算与语言 2025-09-03 v2

摘要

奖励设计在将大语言模型与人类价值观对齐方面起着关键作用,是反馈信号与模型优化之间的桥梁。本综述对奖励建模进行了结构化梳理,并探讨了三个关键方面:数学公式、构建实践以及与优化范式的交互。在此基础上,它发展了一个宏观层面的分类法,沿互补维度刻画奖励机制,从而为对齐研究提供概念清晰性和实践指导。大语言模型对齐的进展可以理解为奖励设计策略的持续优化,近期发展突显了从基于强化学习的优化到无强化学习优化,以及从单任务到多目标和复杂场景的范式转变。

关键词

引用

@article{arxiv.2505.02666,
  title  = {A Survey on Progress in LLM Alignment from the Perspective of Reward Design},
  author = {Miaomiao Ji and Yanqiu Wu and Zhibin Wu and Shoujin Wang and Jian Yang and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2505.02666},
  year   = {2025}
}

备注

Preprint