中文

XQC:基于良好条件优化的深度强化学习

机器学习 2026-03-17 v2 人工智能

摘要

样本效率是有效深度强化学习算法的核心属性。最近的研究通过增加复杂性(如更大模型、特殊网络架构和更复杂算法)来提升此指标,这些技术通常仅凭经验性能受益。我们采取更原则的方法,聚焦于价值网络优化景观。通过分析价值网络 Hessian 矩阵的特征谱和条件数,系统性地探讨常见架构设计决策对训练动力学的影响。我们的分析表明,批归一化(BN)、权重归一化(WN)和分布式交叉熵(CE)损失的一种新型组合,能够使条件数比基线方法小几个数量级。该组合还自然界限了梯度范数,这一性质对于在非稳态目标和引导下保持稳定有效学习率至关重要。基于这些洞见,我们提出XQC:一个以软强化学习为基础、内置这些优化感知原则的样本高效深度演员-评论家算法。我们在55项本体感知和15项基于视觉的连续控制任务上实现了最先进的样本效率,同时使用的数据量比竞争方法显著更少。我们的代码已公开于 danielpalenicek.github.io/projects/xqc。

关键词

引用

@article{arxiv.2509.25174,
  title  = {XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning},
  author = {Daniel Palenicek and Florian Vogt and Joe Watson and Ingmar Posner and Jan Peters},
  journal= {arXiv preprint arXiv:2509.25174},
  year   = {2026}
}