中文

解决序列建模用于强化学习中的乐观偏差

机器学习 2022-07-22 v1 人工智能 机器人学

摘要

基于Transformer神经网络架构的自然语言处理(NLP)令人印象深刻的成果,启发了研究者将离线强化学习(RL)视为通用序列建模问题。基于该范式近期的工作在多个大多确定性的离线Atari和D4RL基准上取得了最先进(SOTA)结果。然而,由于这些方法将状态与动作联合建模为单一序列问题,它们难以解耦策略与世界动态对回报的影响。因此,在对抗性或随机环境中,这些方法导致过度乐观的行为,在自动驾驶等安全关键系统中可能是危险的。本工作提出一种方法,通过显式解耦策略模型与世界模型来解决此乐观偏差,从而使我们在测试时能够搜索对环境多种可能未来具有鲁棒性的策略。我们在仿真中的多种自动驾驶任务上展示了方法的优越性能。

关键词

引用

@article{arxiv.2207.10295,
  title  = {Addressing Optimism Bias in Sequence Modeling for Reinforcement Learning},
  author = {Adam Villaflor and Zhe Huang and Swapnil Pande and John Dolan and Jeff Schneider},
  journal= {arXiv preprint arXiv:2207.10295},
  year   = {2022}
}