目标交换的离线目标条件强化学习
机器学习
2023-02-20 v1 人工智能
摘要
离线目标条件强化学习(GCRL)可能因对给定数据集的过拟合而具有挑战性。为使智能体的技能推广到给定数据集之外,我们提出一种生成额外轨迹的目标交换过程。为缓解噪声与外推误差问题,我们提出一种称为确定性 Q-优势策略梯度(DQAPG)的通用离线强化学习方法。在实验中,DQAPG 在广泛的基准任务上优于最先进的目标条件离线 RL 方法,且目标交换进一步改善了测试结果。值得注意的是,所提方法在具有挑战性的灵巧手内操作任务上取得了良好性能,而先前方法均告失败。
引用
@article{arxiv.2302.08865,
title = {Swapped goal-conditioned offline reinforcement learning},
author = {Wenyan Yang and Huiling Wang and Dingding Cai and Joni Pajarinen and Joni-Kristen Kämäräinen},
journal= {arXiv preprint arXiv:2302.08865},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2302.07741