中文

通过再参数化与多样性正则化学习不可解的多模态策略

机器学习 2025-11-04 v1

摘要

传统的连续深度强化学习(RL)算法采用确定性或单模态高斯演员,无法表达复杂的多模态决策分布。这一限制可能阻碍其在关键多样性场景中的性能。已有一些尝试基于扩散或 amortized 演员设计在线多模态RL算法,但这些演员难以计算,导致现有方法在性能、决策多样性和效率之间难以取得平衡。为克服这一挑战,我们首先在统一框架内重新表述现有的难以计算的多模态演员,并证明它们可以通过再参数化直接通过策略梯度进行优化。然后,我们提出一种基于距离的多样性正则化方法,该方法无需显式地要求决策概率。我们识别了两个关键多样性领域,即多目标实现和生成式RL,以展示多模态策略及我们方法的优势,特别是在少样本鲁棒性方面。在常规MuJoCo基准测试中,我们的算法也显示出竞争性能。此外,我们的实验表明,amortized演员是一种具有强大多模态表达力和高性能的有前景的策略模型类。我们的代码可在https://github.com/PneuC/DrAC获取。

关键词

引用

@article{arxiv.2511.01374,
  title  = {Learning Intractable Multimodal Policies with Reparameterization and Diversity Regularization},
  author = {Ziqi Wang and Jiashun Liu and Ling Pan},
  journal= {arXiv preprint arXiv:2511.01374},
  year   = {2025}
}

备注

NeurIPS 2025