中文

理解、预测并更好地解决离线强化学习中的 Q 值发散问题

机器学习 2023-11-08 v2

摘要

Q 值估计的发散一直是离线 RL 中的一个突出问题,其中智能体无法访问真实动态。传统观点将此不稳定性归因于在自举价值目标时查询分布外动作。尽管可通过策略约束或保守 Q 估计缓解该问题,但关于导致发散的底层机制的理论理解尚属空白。本工作中,我们旨在彻底理解该机制并获得改进方案。我们首先确定一种基本模式——自激(self-excitation)为离线 RL 中 Q 值估计发散的主因。随后,我们基于神经正切核(Neural Tangent Kernel, NTK)提出一种新颖的自激特征值度量(Self-Excite Eigenvalue Measure, SEEM)指标,用以衡量训练中 Q 网络演化特性,该指标对发散的出现给出了引人入胜的解释。我们的理论首次能在早期阶段可靠判断训练是否会发散,甚至在使用 SGD 优化器时预测估计 Q 值、模型范数及崩溃步长的增长阶数。实验表明与这一理论分析完全吻合。基于我们的洞见,我们提出从一新视角解决发散,即改进模型架构以获得更好的外推行为。通过广泛实证研究,我们确定 LayerNorm 为一种良好方案,可在不引入有害偏差的情况下有效避免发散,从而带来优越性能。实验结果证明,其仍可在某些最具挑战性的设定下工作,即仅使用数据集的 1 条转移,而此前所有方法均告失败。此外,它可轻松插入现代离线 RL 方法中,并在许多挑战性任务上取得 SOTA 结果。我们也对其有效性给出了独特见解。

关键词

引用

@article{arxiv.2310.04411,
  title  = {Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL},
  author = {Yang Yue and Rui Lu and Bingyi Kang and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2310.04411},
  year   = {2023}
}

备注

31 pages, 20 figures