面向变化稀疏奖励环境的自适应方差
机器人学
2019-05-10 v2 人工智能
摘要
在固定环境中训练以执行任务的机器人,常因缺乏探索而在面临环境意外变化时失败。我们提出一种原则性方法,用于在变化的稀疏奖励环境中调整策略以更好地探索。不同于以往显式建模环境变化的工作,我们分析了值函数与高斯参数化策略的最优探索之间的关系,并表明我们的理论导出了一种调整策略方差的有效策略,从而能够在多种稀疏奖励环境中快速适应变化。
引用
@article{arxiv.1903.06309,
title = {Adaptive Variance for Changing Sparse-Reward Environments},
author = {Xingyu Lin and Pengsheng Guo and Carlos Florensa and David Held},
journal= {arXiv preprint arXiv:1903.06309},
year = {2019}
}
备注
Accepted as a conference at International Conference on Robotics and Automation(ICRA) 2019