SAVOR:基于视觉-触觉感知的技能可供性学习及其在机器人辅助进食获取中的应用
机器人学
2025-09-03 v2
摘要
机器人辅助进食需要可靠的咬取操作,由于餐具与具有不同物理属性的食物之间存在复杂的交互,这是一项具有挑战性的任务。这些交互因食物属性的时间变异性而进一步复杂化——例如,牛排在用餐过程中冷却时会变硬。为了解决这个问题,我们提出了 SAVOR,一种用于学习咬取操作技能可供性的新方法——即特定操作技能(如叉取、舀取)对给定餐具-食物交互的适用程度。在我们的表述中,技能可供性源于工具可供性(餐具能做什么)和食物可供性(食物允许什么)的结合。工具可供性通过离线校准学习,其中不同的餐具与各种食物交互以建模其功能能力。食物可供性由柔软度、湿度和粘度等物理属性表征,最初通过使用视觉条件语言模型的常识推理进行推断,然后在交互过程中使用 SAVOR-Net 通过在线多模态视觉-触觉感知进行动态优化。我们的方法集成了这些离线和在线估计,以实时预测技能可供性,使机器人能够为每种食物选择最合适的技能。在 20 种单一食物和 10 种实际环境中的餐食上进行了评估,我们的方法将咬取成功率比最先进的(SOTA)基于类别的方法(例如,对水果使用叉子)提高了 13%。这些结果突出了建模交互驱动的技能可供性对于可泛化且有效的机器人辅助咬取的重要性。网站:https://emprise.cs.cornell.edu/savor/
引用
@article{arxiv.2506.02353,
title = {SAVOR: Skill Affordance Learning from Visuo-Haptic Perception for Robot-Assisted Bite Acquisition},
author = {Zhanxin Wu and Bo Ai and Tom Silver and Tapomayukh Bhattacharjee},
journal= {arXiv preprint arXiv:2506.02353},
year = {2025}
}
备注
Conference on Robot Learning, Oral