不能指望运气:决策变换器和RvS为何在随机环境中失效
机器学习
2022-11-29 v2 人工智能
摘要
近来,诸如Decision Transformer等将强化学习化简为预测任务并通过监督学习(RvS)解决的方法因其简单性、对超参数的鲁棒性以及在离线RL任务上强劲的整体表现而流行。然而,在随机环境中,简单地以期望回报为条件训练概率模型并采用预测动作可能惨败,因为达成某回报的轨迹可能仅因运气而获得该回报。本工作中,我们描述了RvS方法在随机环境中的局限并给出一种解决方案。与标准做法仅以单条轨迹的回报为条件不同,我们提出的方法ESPER学习对轨迹聚类,并以聚类平均回报为条件,其与环境随机性无关。如此一来,ESPER能在真实环境中实现目标回报与期望性能间的强对齐。我们在若干具挑战性的随机离线RL任务中展示了这一点,包括难题游戏2048,以及与随机对手对弈的四子棋。在所有测试领域中,ESPER在目标回报与达成回报的对齐上显著优于仅以回报为条件的做法。ESPER甚至取得了比基于价值的基线更高的最大性能。
引用
@article{arxiv.2205.15967,
title = {You Can't Count on Luck: Why Decision Transformers and RvS Fail in Stochastic Environments},
author = {Keiran Paster and Sheila McIlraith and Jimmy Ba},
journal= {arXiv preprint arXiv:2205.15967},
year = {2022}
}
备注
Added experiments with Decision Transformers; Fixed error in Theorem 2.1; Updated related works; Added link for code