基于模型的强化学习中的 Lipschitz 连续性
机器学习
2018-07-30 v3 人工智能
机器学习
摘要
我们研究了在基于模型的强化学习背景下学习 Lipschitz 连续模型的影响。我们给出了 Lipschitz 模型多步预测误差的一个新界限,其中使用 Wasserstein 度量来量化误差。我们进一步证明了由 Lipschitz 模型得出的价值函数估计的误差界限,并表明估计的价值函数本身也是 Lipschitz 的。最后我们以实证结果收尾,展示了控制神经网络模型的 Lipschitz 常数的益处。
引用
@article{arxiv.1804.07193,
title = {Lipschitz Continuity in Model-based Reinforcement Learning},
author = {Kavosh Asadi and Dipendra Misra and Michael L. Littman},
journal= {arXiv preprint arXiv:1804.07193},
year = {2018}
}
备注
Accepted for the 35th International Conference on Machine Learning (ICML 2018)