DexVLG:大规模力觉-语言-抓取模型
计算机视觉与模式识别
2025-07-04 v1 机器人学
摘要
随着大型模型的流行,视觉-语言-动作(VLA)系统正在使机器人能够处理日益复杂的任务。然而,由于数据收集的困难,进展主要集中在控制简单抓手末端执行器方面。对于人类力觉手的功能抓取,很少有研究关注大规模模型。本文引入 DexVLG,一个大型视觉-语言-抓取模型,用于基于单视图 RGBD 输入的力觉抓取姿态预测,与语言指令对齐。为实现这一目标,我们生成了一个包含 1.7 亿个力觉抓取姿态的数据集,这些姿态映射到 17.4 万种物体的语义部件上,并配有详细的部件级描述。这个大规模数据集称为 DexGraspNet 3.0,用于训练能够为桌面物体产生指令对齐抓取姿态的 VLM 和基于流匹配的姿态头。在评估 DexVLG 性能方面,我们创建了物理仿真基准并进行了实际实验。广泛的测试表明,DexVLG 在零样本泛化方面表现出强大的能力——在仿真中实现超过 76% 的零样本执行成功率,并在仿真中实现了最先进的部件抓取精度;在实际场景中成功实现了部件对齐抓取。
引用
@article{arxiv.2507.02747,
title = {DexVLG: Dexterous Vision-Language-Grasp Model at Scale},
author = {Jiawei He and Danshi Li and Xinqiang Yu and Zekun Qi and Wenyao Zhang and Jiayi Chen and Zhaoxiang Zhang and Zhizheng Zhang and Li Yi and He Wang},
journal= {arXiv preprint arXiv:2507.02747},
year = {2025}
}