中文

AffordanceLLM:从视觉语言模型中确立可供性

计算机视觉与模式识别 2024-04-19 v2 机器人学

摘要

可供性确立是指寻找物体上可供人交互区域的任务。这是一项基础但具有挑战性的任务,因为成功的解决方案需要在多个方面全面理解场景,包括对物体及其部件的检测、定位和识别,场景的地理空间配置/布局,3D 形状和物理学,以及物体与人类的功能和潜在交互。许多知识是隐藏的,超出了带有有限训练集监督标签的图像内容。在本文中,我们尝试利用来自预训练大规模视觉语言模型的丰富世界、抽象和人-物交互知识,来提高当前可供性确立的泛化能力。在 AGD20K 基准下,我们提出的模型在自然场景物体可供性确立方面展示了相对于竞争方法的显著性能提升。我们进一步证明,即使物体和动作在训练期间均未被见过,它也能为来自随机互联网图像的物体确立可供性。项目网站:https://jasonqsy.github.io/AffordanceLLM/

关键词

引用

@article{arxiv.2401.06341,
  title  = {AffordanceLLM: Grounding Affordance from Vision Language Models},
  author = {Shengyi Qian and Weifeng Chen and Min Bai and Xiong Zhou and Zhuowen Tu and Li Erran Li},
  journal= {arXiv preprint arXiv:2401.06341},
  year   = {2024}
}