中文

基于聚类的权重正交化:稳定深度强化学习

机器学习 2025-11-18 v1 人工智能

摘要

强化学习(RL)取得了显著进展,在各种任务中实现了超人类的表现。然而,RL智能体通常假设环境的平稳性,这在学习效率面临挑战,因为许多环境本质上是非平稳的。这种非平稳性导致需要数百万次迭代,从而降低样本效率。为解决此问题,本文引入了聚类正交权重修改(Clustering Orthogonal Weight Modified,COWM)层,可集成到任何RL算法的策略网络中,有效缓解非平稳性。COWM层通过采用聚类技术和投影矩阵来稳定学习过程。我们的ethods不仅提高学习速度,还减少梯度干扰,从而提升整体学习效率。实验结果表明,COWM在基于视觉和基于状态的DMControl基准测试中,分别 outperform最新方法,提升了9%和12.6%。它在各种算法和任务上也表现出稳健性和通用性。

关键词

引用

@article{arxiv.2511.11607,
  title  = {Clustering-Based Weight Orthogonalization for Stabilizing Deep Reinforcement Learning},
  author = {Guoqing Ma and Yuhan Zhang and Yuming Dai and Guangfu Hao and Yang Chen and Shan Yu},
  journal= {arXiv preprint arXiv:2511.11607},
  year   = {2025}
}