中文

面向离线强化学习的伪相关消减

机器学习 2023-11-02 v3 人工智能

摘要

离线强化学习(RL)利用海量数据集解决序贯决策问题。现有论文大多仅讨论防御分布外(OOD)动作,而我们研究一个更广泛的问题,即认知不确定性与决策之间的伪相关,这是导致次优性的关键因素。在本文中,我们提出用于离线RL的伪相关消减(SCORE),一种实际有效且理论可证的算法。我们通过实验表明,SCORE在标准基准(D4RL)的多种任务上以3.1倍加速取得SOTA性能。所提算法引入退火行为克隆正则化器,有助于产生高质量的不确定性估计,这对消除次优性中的伪相关至关重要。理论上,我们论证了所提方法的合理性,并在温和假设下证明其以次线性速率收敛到最优策略。

关键词

引用

@article{arxiv.2110.12468,
  title  = {False Correlation Reduction for Offline Reinforcement Learning},
  author = {Zhihong Deng and Zuyue Fu and Lingxiao Wang and Zhuoran Yang and Chenjia Bai and Tianyi Zhou and Zhaoran Wang and Jing Jiang},
  journal= {arXiv preprint arXiv:2110.12468},
  year   = {2023}
}

备注

16 pages, 14 figures