中文

基于风格迁移的引导状态表示以增强深度强化学习泛化能力

机器学习 2022-07-19 v1 人工智能

摘要

深度强化学习(RL)智能体常对训练环境过拟合,导致泛化性能不佳。本文提出 Thinker,一种以无监督方式去除观测中混淆特征的对抗性影响的引导方法,从而改善 RL 智能体的泛化能力。Thinker 首先将经验轨迹聚类为若干簇。随后通过风格迁移生成器对这些轨迹进行引导,该生成器在保持观测内容的同时将轨迹从一簇风格转换到另一簇风格。引导后的轨迹随后用于策略学习。Thinker 在许多 RL 设定中具有广泛适用性。实验结果表明,在 Procgen 基准环境中,相较于基础算法与多种数据增强技术,Thinker 带来了更好的泛化能力。

关键词

引用

@article{arxiv.2207.07749,
  title  = {Bootstrap State Representation using Style Transfer for Better Generalization in Deep Reinforcement Learning},
  author = {Md Masudur Rahman and Yexiang Xue},
  journal= {arXiv preprint arXiv:2207.07749},
  year   = {2022}
}

备注

Accepted at ECML-PKDD 2022