中文

Reward-Zero: 基于语言嵌入的强化学习隐式奖励机制

机器学习 2026-03-11 v1

摘要

我们提出了 Reward-Zero,一种通用的隐式奖励机制,将自然语言任务描述转化为稠密、语义上有 grounding 的进度信号,用于强化学习 (RL)。Reward-Zero 是一种简单而高级的通用奖励函数,利用语言嵌入实现高效 RL 训练。通过比较任务规范的嵌入与代理交互经验中派生的嵌入,Reward-Zero 产生一个连续的、语义对齐的 sense-of-completion 信号。该奖励在无需任务特定工程的情况下补充稀疏或延迟的环境反馈。在集成到标准 RL 框架后,Reward-Zero 加速探索、稳定训练并提高跨 diverse 任务的泛化。在实验上,使用 Reward-Zero 训练的代理收敛更快,最终成功率更高,优于常规方法如 PPO 以及常见奖励塑形基线,成功解决了一些复杂任务中手工设计奖励无法解决的任务。此外,我们开发了一个用于评估任务执行期间完成感的 mini benchmark。这些结果突显了语言驱动的隐式奖励函数作为更高效、更通用和更可扩展 RL 路径的潜力。代码将在同行评审后发布。

关键词

引用

@article{arxiv.2603.09331,
  title  = {Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning},
  author = {Heng Zhang and Haddy Alchaer and Arash Ajoudani and Yu She},
  journal= {arXiv preprint arXiv:2603.09331},
  year   = {2026}
}

备注

under review