通过再参数化与多样性正则化学习不可解的多模态策略
机器学习
2025-11-04 v1
摘要
传统的连续深度强化学习(RL)算法采用确定性或单模态高斯演员,无法表达复杂的多模态决策分布。这一限制可能阻碍其在关键多样性场景中的性能。已有一些尝试基于扩散或 amortized 演员设计在线多模态RL算法,但这些演员难以计算,导致现有方法在性能、决策多样性和效率之间难以取得平衡。为克服这一挑战,我们首先在统一框架内重新表述现有的难以计算的多模态演员,并证明它们可以通过再参数化直接通过策略梯度进行优化。然后,我们提出一种基于距离的多样性正则化方法,该方法无需显式地要求决策概率。我们识别了两个关键多样性领域,即多目标实现和生成式RL,以展示多模态策略及我们方法的优势,特别是在少样本鲁棒性方面。在常规MuJoCo基准测试中,我们的算法也显示出竞争性能。此外,我们的实验表明,amortized演员是一种具有强大多模态表达力和高性能的有前景的策略模型类。我们的代码可在https://github.com/PneuC/DrAC获取。
引用
@article{arxiv.2511.01374,
title = {Learning Intractable Multimodal Policies with Reparameterization and Diversity Regularization},
author = {Ziqi Wang and Jiashun Liu and Ling Pan},
journal= {arXiv preprint arXiv:2511.01374},
year = {2025}
}
备注
NeurIPS 2025