中文

基于神经风格迁移的端到端示例驱动仿真到现实强化学习策略迁移及其在机器人切割中的应用

机器人学 2026-01-29 v1

摘要

尽管强化学习已成功应用于复杂、不确定环境中的一系列机器人控制问题,但其对大量数据(通常来自仿真环境)的依赖,加上仿真系统与物理系统之间的领域差距以及现实世界样本的有限可用性,限制了其实际部署。我们提出了一种新颖的强化学习策略仿真到现实迁移方法,该方法基于对神经风格迁移从图像处理领域的重新诠释,从未配对的、无标签的现实世界数据集中合成新的训练数据。我们采用变分自编码器来联合学习用于风格迁移的自监督特征表示,并生成弱配对的源-目标轨迹,以提高合成轨迹的物理真实性。我们基于机器人切割未知材料的案例研究展示了我们方法的应用。与基线方法(包括我们之前的工作、CycleGAN以及基于条件变分自编码器的时间序列翻译)相比,我们的方法在仅需最少现实世界数据的情况下,实现了更优的任务完成时间和行为稳定性。我们的框架展现了对几何和材料变化的鲁棒性,并突显了在无法获得现实世界奖励信息的具有挑战性的高接触任务中进行策略适应的可行性。

关键词

引用

@article{arxiv.2601.20846,
  title  = {End-to-end example-based sim-to-real RL policy transfer based on neural stylisation with application to robotic cutting},
  author = {Jamie Hathaway and Alireza Rastegarpanah and Rustam Stolkin},
  journal= {arXiv preprint arXiv:2601.20846},
  year   = {2026}
}

备注

14 pages, 9 figures. Submitted to Nature Scientific Reports