中文

基于动作树和视觉引导的机器人操纵世界模型提升——ManipDreamer

机器人学 2025-04-24 v1 人工智能

摘要

虽然近期在机器人操纵视频合成方面取得了一些进展,但仍面临显著挑战,包括确保有效的指令遵循和实现高视觉质量。 recent方法如RoboDreamer利用语言分解将指令划分为单独的低层原始指令,通过对这些原始指令进行条件化来实现组合式指令遵循。然而,这些单独的原始指令并不考虑它们之间存在的关系。此外,recent方法忽略了包括深度和语义引导在内的有价值的视觉引导,这两种引导对于增强视觉质量至关重要。本文引入了ManipDreamer,这是一种基于动作树和视觉引导的世界模型。为更好地学习指令原始指令之间的关系,我们将指令表示为动作树并为树节点分配嵌入向量,每个指令可以通过遍历动作树来获取其嵌入向量。这些指令嵌入可用于引导世界模型。为增强视觉质量,我们引入了兼容世界模型的视觉引导适配器,将深度和语义引导相结合。这种视觉适配器增强了视频生成的时序一致性和物理一致性。基于动作树和视觉引导,ManipDreamer显著提升了指令遵循能力和视觉质量。对机器人操纵基准进行全面评估显示,ManipDreamer在seen和unseen任务中在视频质量指标上均实现了大幅提升,在unseen任务中,PSNR从19.55提升至21.05,SSIM从0.7474提升至0.7982,Flow Error从3.506降低至3.201。此外,我们的方法在6个RLbench任务中平均提高了2.5%的机器人操纵任务成功率。

关键词

引用

@article{arxiv.2504.16464,
  title  = {ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance},
  author = {Ying Li and Xiaobao Wei and Xiaowei Chi and Yuming Li and Zhongyu Zhao and Hao Wang and Ningning Ma and Ming Lu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2504.16464},
  year   = {2025}
}

备注

9 pages, 3 figures