中文

用于离线强化学习的状态优势加权

机器学习 2022-11-09 v2 人工智能

摘要

我们提出用于离线强化学习(RL)的状态优势加权。与我们在QSA学习中通常采用的动作优势A(s,a)A(s,a)不同,我们利用状态优势A(s,s)A(s,s^\prime)与QSS学习用于离线RL,从而将动作与价值解耦。我们期望智能体能到达高奖励状态,而动作由智能体如何到达相应状态决定。在D4RL数据集上的实验表明,我们所提方法相较常见基线可实现显著性能。此外,我们的方法在从离线到在线迁移时展现出良好泛化能力。

关键词

引用

@article{arxiv.2210.04251,
  title  = {State Advantage Weighting for Offline RL},
  author = {Jiafei Lyu and Aicheng Gong and Le Wan and Zongqing Lu and Xiu Li},
  journal= {arXiv preprint arXiv:2210.04251},
  year   = {2022}
}

备注

3rd Offline RL workshop at NeurIPS 2022. arXiv admin note: text overlap with arXiv:2206.07989