用于离线强化学习的状态优势加权
机器学习
2022-11-09 v2 人工智能
摘要
我们提出用于离线强化学习(RL)的状态优势加权。与我们在QSA学习中通常采用的动作优势不同,我们利用状态优势与QSS学习用于离线RL,从而将动作与价值解耦。我们期望智能体能到达高奖励状态,而动作由智能体如何到达相应状态决定。在D4RL数据集上的实验表明,我们所提方法相较常见基线可实现显著性能。此外,我们的方法在从离线到在线迁移时展现出良好泛化能力。
引用
@article{arxiv.2210.04251,
title = {State Advantage Weighting for Offline RL},
author = {Jiafei Lyu and Aicheng Gong and Le Wan and Zongqing Lu and Xiu Li},
journal= {arXiv preprint arXiv:2210.04251},
year = {2022}
}
备注
3rd Offline RL workshop at NeurIPS 2022. arXiv admin note: text overlap with arXiv:2206.07989