优先化离线目标交换经验回放
机器学习
2023-03-07 v2 人工智能
摘要
在目标条件离线强化学习中,智能体从先前收集的数据中学习以到达任意目标。由于离线数据仅包含有限数量的轨迹,一个主要挑战是如何生成更多数据。目标交换通过切换轨迹目标来生成额外数据,但这样做会产生大量无效轨迹。为解决此问题,我们提出优先化目标交换经验回放(PGSER)。PGSER使用预训练的Q函数来为允许到达目标的目标交换转移分配更高的优先权重。在实验中,PGSER在广泛的基准任务中显著优于基线,包括具有挑战性且先前未成功的灵巧手内操作任务。
引用
@article{arxiv.2302.07741,
title = {Prioritized offline Goal-swapping Experience Replay},
author = {Wenyan Yang and Joni Pajarinen and Dinging Cai and Joni Kämäräinen},
journal= {arXiv preprint arXiv:2302.07741},
year = {2023}
}