中文

父模型引导语义奖励模型(PGSRM):基于嵌入的强化学习奖励函数

机器学习 2025-12-09 v1

摘要

我们介绍了父模型引导语义奖励模型(Parent-Guided Semantic Reward Model, PGSRM),这是一种用于 transformer 语言模型强化学习 (RL) 的轻量级奖励框架。PGSRM 用一个简单信号取代二元正确信号、人类偏好数据和训练好的奖励模型:即父模型对同一输入的参考输出嵌入与子模型生成的输出嵌入之间的余弦相似度。这产生了一个稠密且语义上有意义的奖励,无需人工标注或额外模型训练。我们在五个语言任务上应用 PGSRM,发现它比二元奖励基线产生更平滑的奖励改进和更稳定的 PPO 动力学,表明基于嵌入的语义奖励是小型 transformer 模型进行父模型引导对齐的实用替代方案。

关键词

引用

@article{arxiv.2512.06920,
  title  = {Parent-Guided Semantic Reward Model (PGSRM): Embedding-Based Reward Functions for Reinforcement Learning of Transformer Language Models},
  author = {Alexandr Plashchinsky},
  journal= {arXiv preprint arXiv:2512.06920},
  year   = {2025}
}