2HandedAfforder:从人类视频中学习精确的可操作双侧可操作性
计算机视觉与模式识别
2025-07-03 v3 机器学习
机器人学
摘要
在与物体交互时,人类能够有效推理哪些物体区域适合执行预期动作,即物体的affordance区域。他们还能根据所执行的任务以及需要使用一只手还是两只手,考虑物体区域的细微差异。然而,当前的基于视觉的affordance预测方法通常将问题简化为朴素的物体部件分割。在这项工作中,我们提出了一种从人类活动视频数据集中提取affordance数据的框架。我们提取的2HANDS数据集包含精确的物体affordance区域分割以及作为活动叙述的affordance类别标签。数据还考虑了双侧动作,即两只手协调并与一个或多个物体进行交互。我们提出了一种基于VLM的affordance预测模型2HandedAfforder,在该数据集上训练,并在各种活动的affordance区域分割任务中展示了优于基线的性能。最后,我们通过机器人操作场景中的演示展示了预测的affordance区域是可操作的,即可以被执行任务的智能体使用。项目网站:https://sites.google.com/view/2handedafforder
引用
@article{arxiv.2503.09320,
title = {2HandedAfforder: Learning Precise Actionable Bimanual Affordances from Human Videos},
author = {Marvin Heidinger and Snehal Jauhri and Vignesh Prasad and Georgia Chalvatzaki},
journal= {arXiv preprint arXiv:2503.09320},
year = {2025}
}
备注
ICCV 2025