中文

LacaDM:用于多目标强化学习的潜在因果扩散模型

机器学习 2025-12-23 v1 人工智能

摘要

多目标强化学习(MORL)由于目标之间固有的冲突以及难以适应动态环境而面临重大挑战。传统方法在大规模和复杂的状态-动作空间中难以有效泛化。为解决这些限制,我们引入了潜在因果扩散模型(LacaDM),一种新方法,旨在增强 MORL 在离散和连续环境中的适应性。与现有方法主要解决目标之间冲突不同,LacaDM 学习环境状态与策略之间的潜在时间因果关系,实现了在 diverse MORL 场景间的高效知识迁移。通过将这些因果结构嵌入基于扩散模型的框架,LacaDM 在保持强泛化能力的同时,在之前未见过的环境中实现了对冲突目标的平衡。在 various 任务上的经验评估表明,LacaDM 在 hypervolume、稀疏性和 expected utility 最大化方面 consistently 超过了 state-of-the-art baseline,展示了其在复杂多目标任务中的有效性。

关键词

引用

@article{arxiv.2512.19516,
  title  = {LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning},
  author = {Xueming Yan and Bo Yin and Yaochu Jin},
  journal= {arXiv preprint arXiv:2512.19516},
  year   = {2025}
}