中文

通过 VLM 规划的原子技能演示进行柔性操作策略学习

机器人学 2025-11-11 v1

摘要

长时程、富接触操作任务的自主执行传统上需要大量真实世界数据和专家工程,带来了显著的成本和可扩展性挑战。本文提出了一种集成分层语义分解、强化学习 (RL)、视觉语言模型 和知识蒸馏的新框架,以克服这些限制。复杂任务被分解为原子技能,并在模拟中为每个基元训练 RL 策略。关键的是,我们的 RL 公式包含显式力约束,以防止在精细交互中损坏物体。VLM 执行高级任务分解和技能规划,生成多样化的专家演示。这些演示通过视觉-触觉扩散策略 蒸馏为统一策略,用于端到端执行。我们进行了全面的消融研究,探索不同的基于 VLM 的任务规划器以确定最佳演示生成流程,并系统地比较了用于技能蒸馏的模仿学习算法。广泛的模拟实验和物理部署验证了我们的方法能够在无需昂贵人类演示的情况下实现长时程操作的策略学习,同时 VLM 引导的原子技能框架能够可扩展地泛化到各种任务。

关键词

引用

@article{arxiv.2511.05855,
  title  = {Gentle Manipulation Policy Learning via Demonstrations from VLM Planned Atomic Skills},
  author = {Jiayu Zhou and Qiwei Wu and Jian Li and Zhe Chen and Xiaogang Xiong and Renjing Xu},
  journal= {arXiv preprint arXiv:2511.05855},
  year   = {2025}
}

备注

Accepted for the 40th Annual AAAI Conference on Artificial Intelligence (2026)