中文

面向在线交互的分布鲁棒离动力学强化学习样本复杂度

机器学习 2025-11-10 v1 人工智能 机器人学 机器学习

摘要

离动力学强化学习(RL),即训练和部署之间的状态-动作动力学不同, can be formulated as learning in a robust Markov decision process (RMDP) where uncertainties in transition dynamics are imposed。现有文献大多假设可获得生成模型,允许任意状态-动作查询,或是预收集的数据集,具备良好状态覆盖,以部署环境,绕过探索的挑战。本文中,我们研究了更真实且更具挑战性的设置,即智能体仅限于与训练环境进行在线交互。为捕捉在线 RMDP 中探索内在难度,我们引入了优越访问比率这一新量,其衡量训练动力学与部署动力学之间的不匹配程度。我们表明,如果该比率是无界的,在线学习将变得指数级困难。我们提出了首个在 f-divergence 基于转移不确定性的在线 RMDP 中实现亚线性后悔的计算高效算法。我们也建立了匹配的后悔下界,表明我们的算法在优越访问比率和互动剂集的数量上均实现了最优依赖。最后,我们通过全面的数值实验验证了我们的理论结果。

关键词

引用

@article{arxiv.2511.05396,
  title  = {Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction},
  author = {Yiting He and Zhishuai Liu and Weixin Wang and Pan Xu},
  journal= {arXiv preprint arXiv:2511.05396},
  year   = {2025}
}

备注

53 pages, 6 figures, 3 tables. Published in Proceedings of the 42nd International Conference on Machine Learning (ICML 2025)