中文

基于隐统一状态表示的强化学习域适应

机器学习 2021-09-06 v2 人工智能

摘要

尽管深度强化学习(RL)近期取得进展,域适应仍是一个开放问题。虽然 RL 智能体的泛化能力对深度 RL 在真实世界中的适用性至关重要,但零样本策略迁移仍具挑战,因为即便是微小的视觉变化也可能使训练好的智能体在新任务中完全失败。为解决此问题,我们提出一种两阶段 RL 智能体:第一阶段先学习跨多个域一致的隐统一状态表示(LUSR),第二阶段基于 LUSR 在一个源域中进行 RL 训练。LUSR 的跨域一致性使得从源域获得的策略无需额外训练即可泛化到其他目标域。我们首先在带有自定义操作的 CarRacing 游戏变体中验证该方法,随后在具有更复杂真实视觉观测的自动驾驶模拟器 CARLA 中进行验证。结果表明,该方法在相关 RL 任务中能达到最先进的域适应性能,并优于此前基于隐表示 RL 和图像到图像翻译的方法。

关键词

引用

@article{arxiv.2102.05714,
  title  = {Domain Adaptation In Reinforcement Learning Via Latent Unified State Representation},
  author = {Jinwei Xing and Takashi Nagata and Kexin Chen and Xinyun Zou and Emre Neftci and Jeffrey L. Krichmar},
  journal= {arXiv preprint arXiv:2102.05714},
  year   = {2021}
}

备注

Accepted by AAAI 2021; Fixed a typo in equation 3