面向功能性灵活抓取的多关键点 affordance 表示
机器人学
2025-08-13 v2 计算机视觉与模式识别
图像与视频处理
摘要
功能性灵活抓取需要精确的手-物体交互,远超简单的抓取。现有基于affordance的方法主要预测粗糙的交互区域,无法直接约束抓取姿态,导致视觉感知与操作之间存在断层。为此,我们提出一种用于功能性灵活抓取的多关键点affordance表示方法,通过局部化功能接触点直接编码任务驱动的抓取配置。该方法引入了基于接触引导的多关键点affordance (CMKA) 模型,利用人类抓取经验图像进行弱监督,并结合大规模视觉模型提取精细的affordance特征,实现泛化且避免手动关键点标注。此外,我们提出了基于关键点的抓取矩阵转换 (KGT) 方法,确保手部关键点与物体接触点之间的空间一致性,从而在视觉感知与灵活抓取动作之间提供直接关联。在公开的真实世界FAH数据集、IsaacGym仿真环境以及具备挑战性的机器人任务中进行实验,结果表明,我们的方法在affordance定位精度、抓取一致性以及对未见工具和任务的泛化性方面均显著提升,弥合了视觉affordance学习与灵活机器人操作之间的鸿沟。源代码和演示视频已公开发布于 https://github.com/PopeyePxx/MKA。
关键词
引用
@article{arxiv.2502.20018,
title = {Multi-Keypoint Affordance Representation for Functional Dexterous Grasping},
author = {Fan Yang and Dongsheng Luo and Wenrui Chen and Jiacheng Lin and Junjie Cai and Kailun Yang and Zhiyong Li and Yaonan Wang},
journal= {arXiv preprint arXiv:2502.20018},
year = {2025}
}
备注
Accepted to IEEE Robotics and Automation Letters (RA-L). The source code and demo videos are publicly available at https://github.com/PopeyePxx/MKA