离线域随机化的统计保证
机器学习
2026-02-05 v2 机器人学
摘要
强化学习(RL)代理在从仿真部署到真实世界时常常难以克服。减少仿真-现实差距的主流策略是域随机化(DR),即通过采样动力学参数来训练跨多个仿真器的策略,但标准DR忽略了已从真实系统获取的离线数据。我们研究离线域随机化(ODR),即首先拟合一个关于仿真器参数的分布,以匹配离线数据集。尽管越来越多的实证工作报告了诸如DROPO等算法的显著提升,但ODR的理论基础仍基本未探讨。本文将ODR建模为参数化仿真器族的最大似然估计,并提供统计保证:在 mild的正则性和可识别性条件下,估计量是弱一致的(即随数据增长,估计值以概率收敛于真实动力学),当满足额外的均匀 Lipschitz 连续性假设时,成为强一致的(即几乎必然收敛于真实动力学)。我们检讨了这些假设的实际可行性,并概述了能够支撑ODR更广泛适用性的松弛条件。总体而言,本文的工作为ODR奠定了原则性基础,阐明了离线数据何时能够可靠地指导随机化分布的选择,以服务于后续的离线RL。
引用
@article{arxiv.2506.10133,
title = {Statistical Guarantees for Offline Domain Randomization},
author = {Arnaud Fickinger and Abderrahim Bendahi and Stuart Russell},
journal= {arXiv preprint arXiv:2506.10133},
year = {2026}
}
备注
ICLR 2026