中文

最大化扩散:基于奖励最大化与扩散控制的对齐研究

计算与语言 2025-02-19 v1 人工智能

摘要

扩散生成的规划、学习和控制方法呈现出一种有前景的、强大且富有表现力的决策解决方案分支。鉴于日益增长的兴趣,此类方法过去几年经历了众多改进。然而,尽管已有这些进步,现有方法仍受限于对决策过程中奖励最大化的一般方法进行的调查有限。在本工作中,我们研究了用于控制应用的精调方法的扩展。具体而言,我们探索了四种精调方法的扩展和各种设计选择:通过强化学习实现奖励对齐、直接偏好优化、监督式精调和级联扩散。我们优化了这些独立努力的使用,将其整合为一个统一的范式。我们展示了这些构想在离线RL环境中的实用性,并在丰富的控制任务上实现了实证性改进。

关键词

引用

@article{arxiv.2502.12197,
  title  = {A Closer Look at System Prompt Robustness},
  author = {Norman Mu and Jonathan Lu and Michael Lavery and David Wagner},
  journal= {arXiv preprint arXiv:2502.12197},
  year   = {2025}
}

备注

Artifacts: https://github.com/normster/RealGuardrails