中文

BayRnTune:基于策略微调的自适应贝叶斯域随机化

机器人学 2023-10-17 v1 机器学习

摘要

域随机化(DR)通过以随机化动力学训练策略,已被证明是一种简单而有效的缩小仿真与现实之间差距的算法。然而,DR 往往需要对随机化参数进行细致调参。贝叶斯域随机化(Bayesian DR)和主动域随机化(Adaptive DR)等方法利用真实世界经验自动选择参数范围,从而解决了这一问题。尽管有效,这些算法通常需要较长的计算时间,因为每次迭代都从零开始训练一个新策略。在本工作中,我们提出基于策略微调的自适应贝叶斯域随机化(BayRnTune),其继承了 BayRn 的思想,但旨在通过从先前学习的策略进行微调来显著加速学习过程。这一想法引出了一个关键问题:在微调时我们应使用哪个先前的策略作为先验?我们研究了四种不同的微调策略,并在五个仿真环境中与基线算法进行比较,环境涵盖从简单基准任务到更复杂的腿式机器人环境。我们的分析表明,与原始域随机化或贝叶斯 DR 相比,我们的方法在相同的步数内获得了更好的奖励。

关键词

引用

@article{arxiv.2310.10606,
  title  = {BayRnTune: Adaptive Bayesian Domain Randomization via Strategic Fine-tuning},
  author = {Tianle Huang and Nitish Sontakke and K. Niranjan Kumar and Irfan Essa and Stefanos Nikolaidis and Dennis W. Hong and Sehoon Ha},
  journal= {arXiv preprint arXiv:2310.10606},
  year   = {2023}
}