迈向基于流预测的可泛化双手基础策略
计算机视觉与模式识别
2025-06-02 v1 机器人学
摘要
由于巨大的动作空间和协调手臂运动的需求,学习可泛化的双手操作策略对具身智能体而言极具挑战性。现有方法依赖视觉-语言-动作(VLA)模型来获取双手策略。然而,从单臂数据集或预训练的 VLA 模型迁移知识往往无法有效泛化,这主要是由于双手数据的稀缺性以及单臂与双手操作之间的根本差异。在本文中,我们通过对领先的文本到视频模型进行微调以预测机器人轨迹,并训练一个轻量级扩散策略用于动作生成,从而提出了一种新颖的双手基础策略。鉴于文本到视频模型缺乏具身知识,我们引入了一种两阶段范式,该范式微调了源自预训练文本到视频模型的独立的文本到流和流到视频模型。具体而言,光流作为中间变量,提供了图像之间细微运动的简洁表示。文本到流模型预测光流以具体化语言指令的意图,而流到视频模型则利用此流进行细粒度的视频预测。我们的方法缓解了单阶段文本到视频预测中语言的歧义性,并通过避免直接使用低级动作显著降低了对机器人数据的需求。在实验中,我们为真实的双臂机器人收集了高质量的操纵数据,仿真和真实世界的实验结果均证明了我们方法的有效性。
引用
@article{arxiv.2505.24156,
title = {Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction},
author = {Chenyou Fan and Fangzheng Yan and Chenjia Bai and Jiepeng Wang and Chi Zhang and Zhen Wang and Xuelong Li},
journal= {arXiv preprint arXiv:2505.24156},
year = {2025}
}