中文

通用机器人操纵策略的有效调优策略

机器人学 2024-10-03 v1 机器学习

摘要

通用机器人操纵策略(GMPs)有望在广泛的任务、设备和环境中进行泛化。然而,现有的策略在面对分布之外的场景时仍感到困难,因为收集足够数据覆盖广泛领域的行动数据本身就具有挑战性。尽管微调提供了一种快速使用有限样本适应GMPs到新领域和任务的实用方法,但我们观察到所得GMPs的性能在微调策略的设计选择上差异巨大。本文首先进行深入的经验研究,探讨GMPs微调策略中关键因素的影响,涵盖动作空间、策略头、监督信号以及可调参数的选择,其中单个配置评估2,500次滚动。我们系统性地讨论并总结了我们的发现,确定了关键设计选择,我们相信这些选择为GMPs微调提供了实用指南。我们观察到,在低数据 regime下,通过精心选择的微调策略,GMPs显著优于最先进的模仿学习算法。本文所呈现的结果为未来研究微调后的GMPs建立了新的基准,并为社区提供了GMPs工具箱的重要补充。

关键词

引用

@article{arxiv.2410.01220,
  title  = {Effective Tuning Strategies for Generalist Robot Manipulation Policies},
  author = {Wenbo Zhang and Yang Li and Yanyuan Qiao and Siyuan Huang and Jiajun Liu and Feras Dayoub and Xiao Ma and Lingqiao Liu},
  journal= {arXiv preprint arXiv:2410.01220},
  year   = {2024}
}