PoseLess:基于 VLM 直接图像映射的无深度视觉到关节控制
机器人学
2025-03-12 v2 计算与语言
摘要
本文提出了 PoseLess,一种用于机械手控制的新颖框架,该框架通过使用投影表示将 2D 图像直接映射到关节角度,从而消除了对显式姿态估计的需求。我们的方法利用通过随机关节配置生成的合成训练数据,实现了对真实世界场景的零样本泛化,以及从机械手到人手的跨形态迁移。通过投影视觉输入并采用基于 Transformer 的解码器,PoseLess 在解决深度模糊和数据稀缺等挑战的同时,实现了鲁棒、低延迟的控制。实验结果表明,在无需依赖任何人工标注数据集的情况下,该方法在关节角度预测精度上取得了具有竞争力的性能。
引用
@article{arxiv.2503.07111,
title = {PoseLess: Depth-Free Vision-to-Joint Control via Direct Image Mapping with VLM},
author = {Alan Dao and Dinh Bach Vu and Tuan Le Duc Anh and Bui Quang Huy},
journal= {arXiv preprint arXiv:2503.07111},
year = {2025}
}