离线强化学习的扩散自加权引导
机器学习
2025-12-24 v2 机器学习
摘要
离线强化学习(RL)给定智能体的历史观察恢复最优策略 。在实际中, 被建模为智能体行为策略 的加权版本,权重函数 作为智能体行为的评论家。尽管基于扩散模型的离线 RL 最近方法显示出有前景的成果,但所需得分的计算困难,因为其依赖于未知的 。本文通过在动作和权重上构建扩散来缓解此问题。通过所提出的设置,所需得分直接来自扩散模型,而无需学习额外网络。我们的主要概念性贡献是一种新型引导方法,其中引导(是 的函数)来自同一扩散模型,因此,我们的提议称为自加权引导(SWG)。我们表明 SWG 在 toy examples 中生成 desired distribution 的样本,并在 D4RL 的具有挑战性的环境中与最先进的方法持平,同时保持简化的训练管道。我们进一步通过对权重公式和可扩展性的消融研究来验证 SWG。
引用
@article{arxiv.2505.18345,
title = {Diffusion Self-Weighted Guidance for Offline Reinforcement Learning},
author = {Augusto Tagle and Javier Ruiz-del-Solar and Felipe Tobar},
journal= {arXiv preprint arXiv:2505.18345},
year = {2025}
}
备注
Published in Transactions on Machine Learning Research (TMLR). 21 pages, 6 figures