中文

目标交换的离线目标条件强化学习

机器学习 2023-02-20 v1 人工智能

摘要

离线目标条件强化学习(GCRL)可能因对给定数据集的过拟合而具有挑战性。为使智能体的技能推广到给定数据集之外,我们提出一种生成额外轨迹的目标交换过程。为缓解噪声与外推误差问题,我们提出一种称为确定性 Q-优势策略梯度(DQAPG)的通用离线强化学习方法。在实验中,DQAPG 在广泛的基准任务上优于最先进的目标条件离线 RL 方法,且目标交换进一步改善了测试结果。值得注意的是,所提方法在具有挑战性的灵巧手内操作任务上取得了良好性能,而先前方法均告失败。

关键词

引用

@article{arxiv.2302.08865,
  title  = {Swapped goal-conditioned offline reinforcement learning},
  author = {Wenyan Yang and Huiling Wang and Dingding Cai and Joni Pajarinen and Joni-Kristen Kämäräinen},
  journal= {arXiv preprint arXiv:2302.08865},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2302.07741