利用视觉、听觉与触觉学习轻柔抓取
机器人学
2025-07-25 v2 计算机视觉与模式识别
机器学习
摘要
在日常生活中,我们经常遇到易碎且会因抓取力过大而受损的物体,例如水果。对于这些物体,轻柔地抓取至关重要——不是使用尽可能大的力,而是使用必要的最小力。本文提出利用视觉、触觉和听觉信号来学习稳定且轻柔地抓取与重新抓取物体。具体而言,我们使用音频信号作为抓取过程中轻柔程度的指标,然后从原始视觉-触觉输入中训练一个端到端的动作条件模型,该模型能够预测未来抓取候选方案的稳定性和轻柔程度,从而允许选择并执行最有希望的动作。在多指手上进行的超过 1,500 次抓取试验的实验结果表明,我们的模型对轻柔抓取是有用的,验证了其预测性能(准确率比仅视觉变体高 3.27%)并提供了对其行为的解释。最后,真实世界实验证实,使用训练好的多模态模型的抓取性能优于其他基线方法(稳定和轻柔抓取率比仅视觉高 17%)。我们的方法既不需要触觉传感器校准,也不需要解析力学建模,从而大幅减少了抓取易碎物体的工程量。数据集和视频可在 https://lasr.org/research/gentle-grasping 获取。
引用
@article{arxiv.2503.07926,
title = {Learning Gentle Grasping Using Vision, Sound, and Touch},
author = {Ken Nakahara and Roberto Calandra},
journal= {arXiv preprint arXiv:2503.07926},
year = {2025}
}
备注
8 pages. Accepted by 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)