中文

用于强化学习的鲁棒视觉域随机化

机器学习 2020-03-09 v2 人工智能

摘要

产生能够泛化到广泛视觉不同环境的智能体是强化学习中的一项重大挑战。克服此问题的方法之一是视觉域随机化,即在每个训练回合开始时对环境的某些视觉方面进行随机化,使智能体暴露于许多可能的变体中。然而,域随机化效率极低,并可能导致跨域高方差的策略。相反,我们提出一种正则化方法:智能体仅在环境的一种变体上训练,并在训练期间将其学习到的状态表示正则化为跨域不变。我们进行的实验表明,我们的技术比标准域随机化实现了更高效且更鲁棒的学习,同时取得了同等的泛化分数。

关键词

引用

@article{arxiv.1910.10537,
  title  = {Robust Visual Domain Randomization for Reinforcement Learning},
  author = {Reda Bahi Slaoui and William R. Clements and Jakob N. Foerster and Sébastien Toth},
  journal= {arXiv preprint arXiv:1910.10537},
  year   = {2020}
}

备注

Accepted at the BeTR-RL Workshop at ICLR 2020