中文

优先化离线目标交换经验回放

机器学习 2023-03-07 v2 人工智能

摘要

在目标条件离线强化学习中,智能体从先前收集的数据中学习以到达任意目标。由于离线数据仅包含有限数量的轨迹,一个主要挑战是如何生成更多数据。目标交换通过切换轨迹目标来生成额外数据,但这样做会产生大量无效轨迹。为解决此问题,我们提出优先化目标交换经验回放(PGSER)。PGSER使用预训练的Q函数来为允许到达目标的目标交换转移分配更高的优先权重。在实验中,PGSER在广泛的基准任务中显著优于基线,包括具有挑战性且先前未成功的灵巧手内操作任务。

关键词

引用

@article{arxiv.2302.07741,
  title  = {Prioritized offline Goal-swapping Experience Replay},
  author = {Wenyan Yang and Joni Pajarinen and Dinging Cai and Joni Kämäräinen},
  journal= {arXiv preprint arXiv:2302.07741},
  year   = {2023}
}