中文

基于模型的强化学习中的 Lipschitz 连续性

机器学习 2018-07-30 v3 人工智能 机器学习

摘要

我们研究了在基于模型的强化学习背景下学习 Lipschitz 连续模型的影响。我们给出了 Lipschitz 模型多步预测误差的一个新界限,其中使用 Wasserstein 度量来量化误差。我们进一步证明了由 Lipschitz 模型得出的价值函数估计的误差界限,并表明估计的价值函数本身也是 Lipschitz 的。最后我们以实证结果收尾,展示了控制神经网络模型的 Lipschitz 常数的益处。

关键词

引用

@article{arxiv.1804.07193,
  title  = {Lipschitz Continuity in Model-based Reinforcement Learning},
  author = {Kavosh Asadi and Dipendra Misra and Michael L. Littman},
  journal= {arXiv preprint arXiv:1804.07193},
  year   = {2018}
}

备注

Accepted for the 35th International Conference on Machine Learning (ICML 2018)