使用预训练神经表征的离线 RL 的不稳定性
机器学习
2021-03-09 v1 人工智能
最优化与控制
机器学习
摘要
在离线强化学习(RL)中,我们试图利用离线数据来评估(或学习)策略,其中数据收集分布与目标待评估策略的分布存在显著差异。近期理论进展表明,若满足某些强表征条件,此类样本高效的离线 RL 确有可能;否则,除非数据收集分布相对于目标策略仅有轻微分布偏移,否则存在展现指数级误差放大(随问题 horizon)的下界。本工作从经验视角研究这些问题,以衡量离线 RL 方法的稳定性。具体而言,我们的方法在使用预训练神经网络特征时探索这些思想,期望这些表征足够强大以允许样本高效的离线 RL。通过在一系列任务上的大量实验,我们发现即使使用此类预训练表征(在同一任务上训练)也会发生显著误差放大;我们发现离线 RL 仅在极轻微分布偏移下稳定。这些结果的理论与经验启示在于,成功的离线 RL(我们寻求超越低分布偏移情形)需要远强于监督学习所需的条件。
引用
@article{arxiv.2103.04947,
title = {Instabilities of Offline RL with Pre-Trained Neural Representation},
author = {Ruosong Wang and Yifan Wu and Ruslan Salakhutdinov and Sham M. Kakade},
journal= {arXiv preprint arXiv:2103.04947},
year = {2021}
}