渐进分辨率策略蒸馏:利用粗分辨率模拟实现高效细分辨率策略学习
机器人学
2026-01-29 v4 机器学习
摘要
在土方与建筑工程中,挖掘机经常遇到混入各种土壤条件的大石块,需要熟练的操作员。本文提出了一种通过强化学习(RL)利用岩石挖掘模拟器实现自主挖掘的框架。在模拟中,分辨率可由整个土壤空间中的粒子大小/数量来定义。细分辨率模拟紧密模拟真实行为,但需要大量计算时间和具有挑战性的样本采集,而粗分辨率模拟使样本采集更快但偏离真实行为。为结合两种分辨率的优势,我们探索利用粗分辨率模拟中开发的策略对细分辨率模拟进行预训练。为此,我们提出了一种新颖的策略学习框架——渐进分辨率策略蒸馏(PRPD),通过一些中间分辨率模拟逐步迁移策略,并采用保守的策略迁移以避免可能导致策略迁移失败的领域差距。在岩石挖掘模拟器和九个真实岩石环境中的验证表明,PRPD将采样时间减少至不到1/7,同时保持了与在细分辨率模拟中进行策略学习相当的任务成功率。更多视频和补充结果可在我们的项目页面https://yuki-kadokawa.github.io/prpd/获取。
引用
@article{arxiv.2412.07477,
title = {Progressive-Resolution Policy Distillation: Leveraging Coarse-Resolution Simulations for Time-Efficient Fine-Resolution Policy Learning},
author = {Yuki Kadokawa and Hirotaka Tahara and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2412.07477},
year = {2026}
}
备注
accepted for IEEE Transactions on Automation Science and Engineering (T-ASE)