HybridGen:面向模仿学习可扩展数据生成的 VLM 引导混合规划
机器人学
2025-03-18 v1 人工智能
摘要
获取大规模且多样化的演示数据对于提升机器人模仿学习的泛化能力至关重要。然而,在真实世界环境中为复杂操作生成此类数据具有挑战性。我们引入了 HybridGen,这是一个集成了视觉语言模型(VLM)和混合规划的自动化框架。HybridGen 采用两阶段流水线:首先,利用 VLM 解析专家演示,将任务分解为依赖专家的片段(用于精确控制的以物体为中心的位姿变换)和可规划片段(通过路径规划合成多样化轨迹);其次,位姿变换大幅扩展第一阶段的数据。关键的是,HybridGen 无需特定的数据格式即可生成大量训练数据,使其广泛适用于各种模仿学习算法,我们也在多种算法上实证展示了这一特性。在七项任务及其变体上的评估表明,使用 HybridGen 训练的智能体在性能和泛化能力上取得了显著提升,平均比 SOTA 方法提高 5%。值得注意的是,在最具挑战性的任务变体中,HybridGen 取得了显著改善,达到 59.7% 的平均成功率,显著优于 Mimicgen 的 49.5%。这些结果证明了其有效性和实用性。
引用
@article{arxiv.2503.13171,
title = {HybridGen: VLM-Guided Hybrid Planning for Scalable Data Generation of Imitation Learning},
author = {Wensheng Wang and Ning Tan},
journal= {arXiv preprint arXiv:2503.13171},
year = {2025}
}