中文

A4-Agent:面向零样本 affordance 推理的智能体框架

计算机视觉与模式识别 2025-12-17 v1 机器人学

摘要

affordance 预测基于语言指令识别对象上交互区域对于具身 AI 至关重要。当前主流的端到端模型将高层推理与低层定位耦合为单一的单体化管道,并依赖经过标注数据集的训练,导致在新对象和未见环境中的泛化能力较差。本文提出 A4-Agent,一种无需训练的智能体框架,将 affordance 预测解耦为三个阶段的管道。我们的框架在测试时协调专用基础模型:(1)一个 Dreamer 利用生成模型可视化交互如何呈现;(2)一个 Thinker 利用大型视觉语言模型决定与哪个对象部件交互;(3)一个 Spotter 协调视觉基础模型精确定位交互区域。通过利用预训练模型的互补优势且无需任务特定微调,我们的零样本框架在多个基准测试中显著优于当前监督方法,并在真实场景中表现出鲁棒的泛化能力。

关键词

引用

@article{arxiv.2512.14442,
  title  = {A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning},
  author = {Zixin Zhang and Kanghao Chen and Hanqing Wang and Hongfei Zhang and Harold Haodong Chen and Chenfei Liao and Litao Guo and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2512.14442},
  year   = {2025}
}