中文

SPQR:利用尖峰随机模型控制强化学习中 Q-ensemble 独立性

机器学习 2024-01-09 v1 人工智能 机器学习

摘要

缓解高估偏差是深度强化学习在更复杂任务或包含分布外数据的离线数据集上取得成功的性能的关键挑战。为克服高估偏差,Q 学习的集成方法已被研究以利用多个 Q 函数的多样性。由于网络初始化一直是促进 Q 函数多样性的主要方法,文献中已研究了启发式设计的多样性注入方法。然而,先前的研究并未尝试从理论角度保证集成体的独立性。通过引入一种基于随机矩阵理论的新型 Q-ensemble 独立性正则化损失,我们提出了用于强化学习的尖峰 Wishart Q-ensemble 独立性正则化(SPQR)。具体来说,我们将难以处理的 Q-ensemble 独立性假设检验准则修改为 Q-ensemble 谱分布与目标 Wigner 半圆分布之间易于处理的 KL 散度。我们在多种在线和离线集成 Q 学习算法中实现了 SPQR。在实验中,SPQR 在在线和离线 RL 基准测试中均优于基线算法。

关键词

引用

@article{arxiv.2401.03137,
  title  = {SPQR: Controlling Q-ensemble Independence with Spiked Random Model for Reinforcement Learning},
  author = {Dohyeok Lee and Seungyub Han and Taehyun Cho and Jungwoo Lee},
  journal= {arXiv preprint arXiv:2401.03137},
  year   = {2024}
}

备注

Published as a conference paper at NeurIPS 23