中文

评估 Model-Agnostic 元学习在 MetaWorld ML10 基准上的表现:机器人操作任务中的快速适应

机器人学 2025-11-18 v1

摘要

元学习算法使能够以最小数据实现对新任务的快速适应,这是实际机器人系统的关键能力。本文评估了 Model-Agnostic 元学习(MAML)结合信任区域策略优化(TRPO)在 MetaWorld ML10 基准上的表现,该基准是一个包含十个多样化机器人操作任务的具有挑战性的套件。我们实现并分析了 MAML-TRPO 能够学习一个通用初始化,以促进跨语义不同操作行为(包括推送、采购和抽屉操作)的few-shot适应。我们的实验表明,MAML 能够实现有效的单次适应,经过单次梯度更新后性能显著提升,在训练任务上达到 21.0% 的最终成功率,在保留的测试任务上达到 13.2%。然而,我们观察到在元训练期间出现的泛化差距,其中测试任务上的性能在训练任务性能持续提高的同时趋于停滞。任务级别的分析揭示了适应效果的高方差,成功率在不同操作技能之间从 0% 到 80% 不等。这些发现凸显了基于梯度的元学习在多样化机器人操作中的潜力与当前局限性,并为未来的工作在任务感知适应和结构化策略架构方面提供了方向。

关键词

引用

@article{arxiv.2511.12383,
  title  = {Evaluating Model-Agnostic Meta-Learning on MetaWorld ML10 Benchmark: Fast Adaptation in Robotic Manipulation Tasks},
  author = {Sanjar Atamuradov},
  journal= {arXiv preprint arXiv:2511.12383},
  year   = {2025}
}

备注

7 pages, 5 figures