基于不确定性感知的安全域随机化:用于外分布检测与策略自适应
机器学习
2025-07-09 v1 机器人学
摘要
在现实环境中部署强化学习 (RL) 策略面临诸多挑战,包括分布迁移、安全问题以及在策略优化期间无法直接进行交互的现实。现有方法,如域随机化 (DR) 和离域 RL,通过直接与目标域交互来增强策略鲁棒性,这种做法本质上是不安全的。我们提出 Uncertainty-Aware RL (UARL),一种新型框架,通过解决外分布检测与策略自适应问题,在训练阶段优先保证安全,无需在目标域进行直接交互。UARL 使用一组 critic ensemble 来量化策略不确定性,并融合渐进式环境随机化,以准备策略应对多样化的现实环境条件。通过在仿真环境中迭代细化高不确定性状态空间的区域,UARL 在无需显式训练于目标域的情况下,提升了对目标域的鲁棒性泛化。我们在 MuJoCo 基准测试和四足机器人上对 UARL 进行评估,证明其在可靠的外分布检测、性能提升以及样本效率方面的有效性。
引用
@article{arxiv.2507.06111,
title = {Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation},
author = {Mohamad H. Danesh and Maxime Wabartha and Stanley Wu and Joelle Pineau and Hsiu-Chin Lin},
journal= {arXiv preprint arXiv:2507.06111},
year = {2025}
}