抗偏置多步离屏目标条件强化学习
机器学习
2023-11-30 v1 人工智能
摘要
在目标条件强化学习(GCRL)中,稀疏奖励带来显著挑战,常阻碍高效学习。尽管多步 GCRL 可提升该效率,但也可能导致目标值中的离屏偏置。本文深入探究这些偏置,将其分为两类截然不同的类别:“shooting”与“shifting”。认识到某些行为策略可加速策略精炼,我们提出旨在利用这些偏置积极面同时最小化其缺点的解决方案,从而能够使用更大的步长来加速 GCRL。实证研究表明,我们的方法确保了韧性与鲁棒的提升,即便在十步学习场景下,也能带来通常超越基线及若干最先进(SOTA)多步 GCRL 基准的学习效率与性能。
引用
@article{arxiv.2311.17565,
title = {Bias Resilient Multi-Step Off-Policy Goal-Conditioned Reinforcement Learning},
author = {Lisheng Wu and Ke Chen},
journal= {arXiv preprint arXiv:2311.17565},
year = {2023}
}
备注
26 pages, 7 figures