通过各向同性高斯表示实现稳定的深度强化学习
机器学习
2026-03-20 v2 人工智能
摘要
深度强化学习系统常常因非平稳性而导致训练过程不稳定,其中学习目标和数据分布随时间演化。在非平稳目标下,我们证明各向同性高斯嵌入是显著优势的。特别是,它们在线性读出器下实现对时间可变目标的稳定跟踪,在固定方差预算下实现最大熵,并鼓励所有表示维度的均衡使用——这些都使代理器更具适应性和稳定性。基于此洞察,我们提出使用Sketched Isotropic Gaussian Regularization来在训练期间将表示塑造成各向同性高斯分布。我们在各种领域上进行了实证验证,表明这一简单且计算开销不大的 метод能在非平稳情形下提高性能,同时减少表示塌陷、神经元 dormancy 和训练不稳定。
引用
@article{arxiv.2602.19373,
title = {Stable Deep Reinforcement Learning via Isotropic Gaussian Representations},
author = {Ali Saheb Pasand and Johan Obando-Ceron and Aaron Courville and Pouya Bashivan and Pablo Samuel Castro},
journal= {arXiv preprint arXiv:2602.19373},
year = {2026}
}