CHDP:用于参数化动作空间强化学习的协同混合扩散策略
人工智能
2026-01-12 v1
摘要
混合动作空间结合了离散选择和连续参数,在机器人控制和游戏人工智能等领域普遍存在。然而,高效建模和优化混合离散-连续动作空间仍然是一个根本性挑战,这主要源于高维环境下有限的策略表达能力和较差的可扩展性。为应对这一挑战,我们将混合动作空间问题视为一个完全合作博弈,并提出了一个协同混合扩散策略(CHDP)框架来解决它。CHDP 采用两个协同智能体,分别利用离散扩散策略和连续扩散策略。连续策略以离散动作的表示为条件,显式地建模了它们之间的依赖关系。这种协同设计使得扩散策略能够利用其表达能力来捕获各自动作空间中的复杂分布。为了缓解在此协同设置中因同时进行策略更新而产生的更新冲突,我们采用了一种促进协同适应的顺序更新方案。此外,为了提高在高维离散动作空间中学习的可扩展性,我们构建了一个将动作空间嵌入到低维潜在空间的码本。这种映射使得离散策略能够在一个紧凑、结构化的空间中学习。最后,我们设计了一种基于 Q 函数的引导机制,以在训练过程中对齐码本的嵌入与离散策略的表示。在具有挑战性的混合动作基准测试中,CHDP 的成功率比最先进的方法高出高达 19.3%。
引用
@article{arxiv.2601.05675,
title = {CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learning in Parameterized Action Space},
author = {Bingyi Liu and Jinbo He and Haiyong Shi and Enshu Wang and Weizhen Han and Jingxiang Hao and Peixi Wang and Zhuangzhuang Zhang},
journal= {arXiv preprint arXiv:2601.05675},
year = {2026}
}
备注
Accepted by AAAI 2026