中文

LLQL:面向强化学习的逻辑似然 Q 学习

机器学习 2023-12-14 v4 人工智能

摘要

现代强化学习(RL)可分为在线与离线两种变体。作为在线与离线 RL 的关键方面,当前关于贝尔曼方程的研究主要围绕优化技术与性能提升展开,而非探索贝尔曼误差的固有结构特性,例如其分布特征。本研究通过对贝尔曼方程的迭代探索来考察贝尔曼近似误差的分布,观察到贝尔曼误差近似服从 Logistic 分布。基于此,我们提出使用 Logistic 最大似然函数(LLoss)替代常用的假设贝尔曼误差服从正态分布的均方误差(MSELoss)。我们在多样的在线与离线环境中通过大量数值实验验证了假设。特别地,我们将 Logistic 修正应用于多种 RL 基线方法的损失函数,并观察到采用 LLoss 的结果一致优于 MSE 对应方法。我们还进行了 Kolmogorov-Smirnov 检验以确认 Logistic 分布的可靠性。此外,我们的理论通过提供基于分布的分析,将贝尔曼误差与比例奖励缩放现象联系起来。进一步,我们对来自 Logistic 分布的采样应用了偏差-方差分解。本研究的理论与实证洞见为未来以贝尔曼误差分布为核心的探究与改进奠定了宝贵基础。

关键词

引用

@article{arxiv.2307.02345,
  title  = {LLQL: Logistic Likelihood Q-Learning for Reinforcement Learning},
  author = {Outongyi Lv and Bingxin Zhou},
  journal= {arXiv preprint arXiv:2307.02345},
  year   = {2023}
}