中文

目标条件化块状MDP中的域不变表示学习

机器学习 2021-10-29 v2 人工智能

摘要

深度强化学习(RL)在解决许多复杂马尔可夫决策过程(MDP)问题中取得成功。然而,智能体在真实世界部署后常面临未预期的环境变化。这些变化通常是虚假的且与底层问题无关,例如视觉输入智能体的背景偏移。不幸的是,深度RL策略通常对这些变化敏感,无法对其鲁棒地行动。这类似于监督学习中的域泛化问题。在这项工作中,我们研究目标条件化RL智能体的该问题。我们在块状MDP设定下提出一个理论框架,刻画目标条件化策略对新环境的可泛化性。在此框架下,我们开发了实用方法PA-SkewFit以增强域泛化。实证评估表明,我们的目标条件化RL智能体能在各种未见测试环境中表现良好,比基线提升50%。

关键词

引用

@article{arxiv.2110.14248,
  title  = {Learning Domain Invariant Representations in Goal-conditioned Block MDPs},
  author = {Beining Han and Chongyi Zheng and Harris Chan and Keiran Paster and Michael R. Zhang and Jimmy Ba},
  journal= {arXiv preprint arXiv:2110.14248},
  year   = {2021}
}

备注

33 pages