范畴政策:连续控制中的多模态策略学习与探索
机器学习
2025-08-20 v1 人工智能
摘要
在深度强化学习(RL)中,无论是确定性策略还是随机策略,通常都被参数化为单一的高斯分布,这限制了所学行为的模式为单一模态。然而,许多实际决策问题的本质偏好使用多模态策略,以促进环境的稳健探索,从而应对稀疏奖励、复杂动力学或对不同情境进行战略性适应的学习挑战。在连续控制领域,这一问题尤为突出,因为探索通常发生在预测最优动作的附近,通过叠加高斯噪声或随机策略的采样过程实现。本文引入范畴政策(Categorical Policies),通过中间范畴分布建模多模态行为模式,然后生成基于所采样模式的条件化输出动作。我们探讨了两种采样方案,既确保离散潜在结构的可微分,又保持高效的梯度基于优化。通过利用潜在范畴分布选择行为模式,我们的方法能够自然表达多模态性,同时通过采样技巧保持完全可微分。我们在一组DeepMind控制套件环境上对多模态策略进行评估,结果表明,由于更好的探索,所学策略的收敛速度更快,性能优于标准高斯策略。我们的结果表明,范畴分布是连续控制中结构化探索和多模态行为表示的强大工具。
引用
@article{arxiv.2508.13922,
title = {Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control},
author = {SM Mazharul Islam and Manfred Huber},
journal= {arXiv preprint arXiv:2508.13922},
year = {2025}
}
备注
6 pages, 4 figures; Has been submitted and accepted at IEEE SMC, 2025