中文

WorldAfford:基于自然语言指令的可供性定位

计算机视觉与模式识别 2024-05-22 v1 人工智能

摘要

可供性定位旨在根据给定指令定位场景图像中被操作物体的交互区域。可供性定位的一个关键挑战是,具身智能体应理解人类指令并分析环境中可以使用哪些工具,以及如何使用这些工具来完成指令。最近的大多数工作主要支持简单的动作标签作为定位可供性区域的输入指令,未能捕捉复杂的人类目标。此外,这些方法通常仅在以物体为中心的图像中识别单个物体的可供性区域,忽略了物体上下文,且难以在实际应用的复杂场景中定位多个物体的可供性区域。为了解决这一问题,我们首次引入了基于自然语言指令的可供性定位新任务,将其从先前使用简单标签扩展到复杂的人类指令。针对这一新任务,我们提出了一个新框架WorldAfford。我们设计了一种新颖的可供性推理思维链提示,以更精确、更合乎逻辑的方式从LLM中推理可供性知识。随后,我们使用SAM和CLIP在图像中定位与可供性知识相关的物体。我们通过可供性区域定位模块识别物体的可供性区域。为了对这一新任务进行基准测试并验证我们的框架,我们构建了一个可供性定位数据集LLMaFF。我们进行了大量实验,验证了WorldAfford在以往的AGD20K和新的LLMaFF数据集上都取得了SOTA表现。特别是,WorldAfford能够定位多个物体的可供性区域,并在环境中的物体无法完全匹配给定指令时提供替代方案。

关键词

引用

@article{arxiv.2405.12461,
  title  = {WorldAfford: Affordance Grounding based on Natural Language Instructions},
  author = {Changmao Chen and Yuren Cong and Zhen Kan},
  journal= {arXiv preprint arXiv:2405.12461},
  year   = {2024}
}