中文

单轨迹分布鲁棒强化学习

机器学习 2024-09-24 v2 人工智能 机器学习

摘要

为缓解经典强化学习(RL)框架严重依赖训练与测试环境一致性的局限,分布鲁棒 RL(DRRL)被提出以提升在一系列环境中的性能,其中可能包含未知测试环境。作为鲁棒性提升的代价,DRRL 涉及在一组分布上优化,其固有难度高于非鲁棒情形中在固定分布上的优化。现有 DRRL 算法要么基于模型,要么无法从单条样本轨迹中学习。本文设计了一种首个完全无模型的 DRRL 算法,称为单轨迹分布鲁棒 Q 学习(DRQ)。我们精心设计了多时间尺度框架,以充分利用逐次到达的样本并直接学习最优分布鲁棒策略而无需对环境建模,从而该算法能以无模型方式沿单条轨迹训练。尽管算法复杂,我们通过推广经典随机逼近工具提供了渐近收敛保证。综合实验结果表明,相较于非鲁棒方法与其他鲁棒 RL 算法,我们所提算法具有更优的鲁棒性与样本复杂度。

关键词

引用

@article{arxiv.2301.11721,
  title  = {Single-Trajectory Distributionally Robust Reinforcement Learning},
  author = {Zhipeng Liang and Xiaoteng Ma and Jose Blanchet and Jiheng Zhang and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2301.11721},
  year   = {2024}
}

备注

First two authors contribute equally