中文

Afford-X:面向任务导向操控的通用且轻量化可 affordance 推理

计算机视觉与模式识别 2025-09-15 v2 机器人学

摘要

对象可 affordance 推理,即根据物理属性推断对象功能,是人类和人工智能(AI)在任务导向规划和活动中必不可少的能力。这种能力依赖于对象物理和功能的常识知识,超越了简单的对象识别。当前用于从感知中进行可 affordance 推理的计算模型缺乏通用性,限制了其在新情境中的应用。与此同时,拥有新兴推理能力的综合性大型语言模型(LLM)面临在局部设备上部署用于任务导向操控的挑战。本文引入 LVIS-Aff,一个包含1496个任务和119k张图片的大规模数据集,旨在增强可 affordance 推理的通用性。利用该数据集,我们开发了Afford-X,一个端到端可训练的可 affordance 推理模型,包含 Verb Attention 和 Bi-Fusion 模块以提高多模态理解。该模型相较于非 LLM 方法的最佳报告结果提升了最高达12.1%,相较于我们之前的会议论文提升了1.2%。此外,它保持紧凑的1.87亿参数规模,推理速度约为GPT-4V API的50倍。我们的工作表明,高效且通用的可 affordance 推理模型可以部署在局部设备上,用于任务导向的操控。我们展示了Afford-X在机器人实现各种任务和环境中的任务导向操控方面的有效性,凸显了其效率优势及其在实际应用中为机器人和AI系统的发展所具有的广泛意义。

关键词

引用

@article{arxiv.2503.03556,
  title  = {Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation},
  author = {Xiaomeng Zhu and Yuyang Li and Leiyao Cui and Pengfei Li and Huan-ang Gao and Yixin Zhu and Hao Zhao},
  journal= {arXiv preprint arXiv:2503.03556},
  year   = {2025}
}