全景 affordance 预测
计算机视觉与模式识别
2026-03-17 v1 机器人学
摘要
Affordance 预测是具身 AI 中感知与行动之间的关键桥梁。然而,现有研究局限于针孔相机模型, suffer from 视野狭窄且观察碎片化,常常遗漏关键的整体环境上下文。本文首次探索全景 affordance 预测,利用 360 度图像捕获全局空间关系和整体场景理解。为支持这一新任务,我们首次引入 PAP-12K,一个包含超过 1,000 张超高分辨率(12k,11904×5952)全景图像,配有超过 12k 项精心标注的 QA 对和 affordance 掩码。进一步,我们提出 PAP,一个受人类视网膠视觉系统启发的无训练、粗到细的管线,旨在解决全景图像中超高分辨率和严重畸变的问题。PAP 通过网格提示实现递归视觉路由,以逐步定位目标,应用自适应凝视机制纠正局部几何畸变,并利用级联 grounding 管线提取精确的实例级掩码。在 PAP-12K 上的实验结果表明,针对标准透视图像设计的现有 affordance 预测方法在全景视觉独有挑战下会出现严重性能下降甚至失效。相比之下,PAP 框架有效克服了这些障碍,显著优于最先进的基线方法,凸显了全景感知在稳健具身智能中的巨大潜力。
引用
@article{arxiv.2603.15558,
title = {Panoramic Affordance Prediction},
author = {Zixin Zhang and Chenfei Liao and Hongfei Zhang and Harold Haodong Chen and Kanghao Chen and Zichen Wen and Litao Guo and Bin Ren and Xu Zheng and Yinchuan Li and Xuming Hu and Nicu Sebe and Ying-Cong Chen},
journal= {arXiv preprint arXiv:2603.15558},
year = {2026}
}