中文

用于机器人控制的掩码生成策略

机器人学 2026-01-27 v2 人工智能

摘要

我们提出掩码生成策略(MGP),一种用于视觉运动模仿学习的新框架。我们将动作表示为离散令牌,并训练一个条件掩码Transformer,该Transformer并行生成令牌,然后快速仅精炼低置信度令牌。我们进一步提出两种新的采样范式:MGP-Short,对马尔可夫任务执行基于分数的并行掩码生成与精炼;以及MGP-Long,在单次前向中预测完整轨迹,并根据新观测动态精炼低置信度动作令牌。凭借全局连贯的预测和鲁棒的自适应执行能力,MGP-Long能够在先前方法难以处理的复杂非马尔可夫任务上实现可靠控制。在涵盖Meta-World和LIBERO基准的150个机器人操作任务上的广泛评估表明,与最先进的扩散和自回归策略相比,MGP实现了快速推理和更高的成功率。具体而言,MGP在150个任务上将平均成功率提高了9%,同时将每序列推理时间减少了高达35倍。它还在动态和缺失观测环境中将平均成功率提高了60%,并解决了其他最先进方法失败的两个非马尔可夫场景。

关键词

引用

@article{arxiv.2512.09101,
  title  = {Masked Generative Policy for Robotic Control},
  author = {Lipeng Zhuang and Shiyu Fan and Florent P. Audonnet and Yingdong Ru and Edmond S. L. Ho and Gerardo Aragon Camarasa and Paul Henderson},
  journal= {arXiv preprint arXiv:2512.09101},
  year   = {2026}
}