中文

MODULI:基于扩散模型解锁偏好泛化的离线多目标强化学习

机器学习 2025-05-28 v2 人工智能

摘要

多目标强化学习(MORL)旨在开发能够同时优化多个相互冲突目标的策略,但需要大量的在线交互。离线 MORL 提供了一条通过训练预收集的数据集以在部署时对任意偏好进行泛化的解决方案。然而,现实中的离线数据集往往保守且局限于特定分布,难以全面覆盖各种偏好,导致出现偏离分布(OOD)的偏好区域。现有的离线 MORL 算法在对 OOD 偏好方面表现不佳,导致生成的策略无法与偏好相匹配。利用扩散模型的卓越表达和泛化能力,我们提出了 MODULI(Multi-objective Diffusion Planner with Sliding Guidance,带滑动导导的多目标扩散规划器),其采用偏好条件扩散模型作为规划器,以生成与各种偏好相匹配的轨迹,并据此推导决策动作。为实现精确生成,MODULI 引入了两种在不同偏好下进行的收益归一化方法,以优化导导。为进一步增强对 OOD 偏好的泛化,MODULI 提出了一种新颖的滑动导导机制,该机制涉及训练一个额外的滑块适配器来捕捉偏好变化的方向。通过集成滑块模块,MODULI 能够从分布内(ID)偏好过渡到生成 OOD 偏好,填补并扩展不完整的帕累托前沿。在 D4MORL 基准上的大量实验表明,我们的算法在离线 MORL 的最新基线之上表现出色,展现出对 OOD 偏好的优异泛化能力。

关键词

引用

@article{arxiv.2408.15501,
  title  = {MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning},
  author = {Yifu Yuan and Zhenrui Zheng and Zibin Dong and Jianye Hao},
  journal= {arXiv preprint arXiv:2408.15501},
  year   = {2025}
}

备注

Accepted by ICML2025, code link: https://github.com/pickxiguapi/MODULI