基于通用策略的不确定性感知系统辨识
机器学习
2022-02-15 v1 人工智能
系统与控制
系统与控制
摘要
Sim2real 迁移主要关注将在仿真中训练的策略迁移到可能含噪声的真实世界环境。与 sim2real 迁移相关的一个常见问题是如何估计真实世界的环境参数,以将仿真环境锚定到该参数。尽管域随机化(DR)等现有方法可以通过在训练期间从参数分布中采样来产生鲁棒策略,但对于给定真实世界设定,尚无确立的方法来辨识相应分布的参数。在这项工作中,我们提出不确定性感知策略搜索(UncAPS),其中我们使用通用策略网络(UPN)在全部环境参数范围内存储仿真训练的任务特定策略,随后以类似 DR 的方式组合相关 UPN 策略,采用鲁棒贝叶斯优化为给定环境精心构建鲁棒策略。这种由策略驱动的锚定预计更高效,因为它仅估计与任务相关的参数集合。此外,我们还在搜索过程中考虑估计不确定性,以产生对偶然不确定性和认知不确定性均鲁棒的策略。我们在一系列含噪声的连续控制环境中对我们的方法进行经验评估,并展示其相较竞争基线的性能提升。
引用
@article{arxiv.2202.05844,
title = {Uncertainty Aware System Identification with Universal Policies},
author = {Buddhika Laknath Semage and Thommen George Karimpanal and Santu Rana and Svetha Venkatesh},
journal= {arXiv preprint arXiv:2202.05844},
year = {2022}
}