中文

凸 Q-learning 的充分探索

最优化与控制 2022-10-19 v1 机器学习

摘要

近年来,学界共同努力寻找同时更高效且更易于分析的强化学习新表述。本文关注一种基于 Manne 最优控制线性规划(LP)表述的方法。其原始版本称为 logistic Q-learning,对偶变体称为凸 Q-learning。本文聚焦后者,同时与前者建立联系。主要贡献如下:(i)凸 Q-learning 的对偶并非精确的 Manne LP 或某版 logistic Q-learning,但具有相似结构,揭示出需要正则化以避免过拟合。(ii)获得了 Q-learning LP 有界解的充分条件。(iii)仿真研究揭示了基于连续时间模型的采样数据系统所面临的数值挑战。该挑战通过状态依赖采样得以解决。理论通过来自 OpenAI gym 的示例应用加以说明。结果表明,在标准 Q-learning 发散的情形(如 LQR 问题)下,凸 Q-learning 仍能成功。

关键词

引用

@article{arxiv.2210.09409,
  title  = {Sufficient Exploration for Convex Q-learning},
  author = {Fan Lu and Prashant Mehta and Sean Meyn and Gergely Neu},
  journal= {arXiv preprint arXiv:2210.09409},
  year   = {2022}
}