中文

线性结构 f 散度正则化下的鲁棒离线强化学习

机器学习 2025-11-03 v2 人工智能 机器人学 机器学习

摘要

提出鲁棒正则化马尔可夫决策过程(RRMDP),通过在价值函数中对转移动力学添加正则化来学习对动力学变化鲁棒的策略。现有方法大多采用非结构化正则化,可能导致在不切实的转移情形下产生保守策略。为此,本文提出一种新框架,即引入潜在结构后的 d 矩形线性 RRMDP(d-RRMDP),其在转移核和正则化中均引入潜在结构。我们关注离线强化学习,即智能体从预收集的数据集中学习策略。我们发展了鲁棒正则化悲观值迭代(R2PVI)算法,采用线性函数逼近在 d-RRMDP 中的鲁棒策略学习,并基于 f 散度的正则化项对转移核进行处理。我们给出 R2PVI 策略次优性间隙的实例相关上界,表明这些上界受数据集覆盖鲁棒可接受转移下最优鲁棒策略所访问状态-动作空间程度的影响。我们建立信息论下界以验证该算法近乎最优。最后,数值实验验证了 R2PVI 学习鲁棒策略并在计算效率方面优于基线方法。

关键词

引用

@article{arxiv.2411.18612,
  title  = {Robust Offline Reinforcement Learning with Linearly Structured f-Divergence Regularization},
  author = {Cheng Tang and Zhishuai Liu and Pan Xu},
  journal= {arXiv preprint arXiv:2411.18612},
  year   = {2025}
}

备注

41 pages, 3 figures, 2 tables. Published in Proceedings of the 42nd International Conference on Machine Learning (ICML 2025)