中文

基于统一视觉语言模型的通用灵巧手操作

机器人学 2026-03-03 v1 计算机视觉与模式识别

摘要

规划可行的灵巧手操作是机器人操作和具身智能中的核心挑战。以往的工作通常依赖对象中心的线索或精确的手-对象交互序列,忽略了来自开放词汇指令所提供的丰富、可组合的指导。我们引入 UniHM,即第一个受自由形式语言命令引导的统一灵巧手操作框架。我们提出了统一手-灵巧分词器,将异构灵巧手形态映射到单个共享码本中,提高了跨灵巧手的泛化能力和对新形态的可扩展性。我们的视觉语言动作模型仅基于人-对象交互数据进行训练,无需大规模真实世界遥操作数据集,即可在从开放式语言指令生成类人操作序列方面表现出强大的泛化能力。为确保物理现实性,我们引入了物理引导的动态细化模块,在生成和时间先验的约束下,对每个关节进行分段优化,生成平滑且物理可行的操作序列。在多个数据集和真实世界评估中,UniHM 在见到的和未见到的对象和轨迹上均实现了最先进的结果,显示出强大的泛化能力和高水平的物理可行性。我们的项目页面链接为 https://unihm.github.io/。

关键词

引用

@article{arxiv.2603.00732,
  title  = {UniHM: Unified Dexterous Hand Manipulation with Vision Language Model},
  author = {Zhenhao Zhang and Jiaxin Liu and Ye Shi and Jingya Wang},
  journal= {arXiv preprint arXiv:2603.00732},
  year   = {2026}
}

备注

Accepted by ICLR 2026