FSAG:通过扩散模型增强人类到灵巧手指尖特定可达性的 grounding
机器人学
2026-03-13 v2
摘要
灵巧抓握必须同时满足功能意图和物理可行性,但现有流程往往会在语义 grounding 与细化之间解耦,导致在对象和姿态变化下接触不稳定或非功能。这种挑战因多指手的高维度和运动多样性而加剧,许多方法依赖大型针对特定硬件的抓取数据集,这些数据集要么是在仿真中收集,要么需要高昂的真实世界试验。我们提出一种数据高效框架,绕过机器人抓取数据收集,利用预训练生成扩散模型中的对象中心语义先验。从原始人类视频演示中提取时间对齐且细粒度的抓握可达性,并与深度图的 3D 场景几何融合,以推断语义 grounding 的接触目标。我们进一步将这些可达性区域纳入抓握细化目标,显式引导每个指尖走向其预测区域以进行优化。 resulting 系统在常见对象和工具上产生稳定、符合人类直觉的多接触抓握,同时在类别内以外的对象实例、姿态变化和多种手部 embodiment 上表现出强大的泛化能力。这一工作 (i) 引入了一种利用视觉-语言生成先验进行灵巧抓握语义可达性提取的管道,(ii) 在不构建硬件特定抓取数据集的情况下演示了跨手泛化,(iii) 表明单一深度模态在结合基础模型语义时即可实现高性能抓握合成。 our results highlight a path toward scalable, hardware-agnostic dexterous manipulation driven by human demonstrations and pretrained generative models.
关键词
引用
@article{arxiv.2601.08246,
title = {FSAG: Enhancing Human-to-Dexterous-Hand Finger-Specific Affordance Grounding via Diffusion Models},
author = {Yifan Han and Yichuan Peng and Pengfei Yi and Junyan Li and Hanqing Wang and Gaojing Zhang and Qi Peng Liu and Wenzhao Lian},
journal= {arXiv preprint arXiv:2601.08246},
year = {2026}
}