CompassAD: 意图驱动的 3D Affordance 定位在功能竞争对象中
计算机视觉与模式识别
2026-05-19 v2 机器人学
摘要
当被告知"切蛋糕"时,机器人必须选择刀具而非附近的剪刀,尽管两个物体都具有相同的切割功能。在真实场景中,多个物体可能共享相同的 affordance,但只有一个在给定任务上下文中是合适的。我们将此类情况称为混淆对。然而,现有的 3D affordance 方法大多通过评估孤立单物体来规避这一挑战,通常在查询中提供明确的类别名称。我们形式化了意图驱动的可混淆 affordance 定位(Intent-Driven Confusable Affordance Grounding),这是一种新的 3D affordance 设置,要求在多对象点云中根据隐式自然语言意图,在正确物体上预测逐点 affordance 掩码。为研究此问题,我们构建了 CompassAD,这是首个以混淆多对象组合中隐式意图为中心的基准。它包含 30 对混淆对象,涵盖 16 种 affordance 类型,6,422 个组合,以及 88K+ 个查询-答案对。此外,我们提出了 CompassNet,一个包含两个专用模块的框架,专为该项任务设计。实例边界交叉注入(ICI)将语言-几何对齐约束在物体边界内,以防止跨对象语义泄露。双层对比优化(BCR)在几何组和点两个层级上强制区分,使目标表面与易混淆表面之间的差异更加清晰。大量实验在已见和未见查询上均展示了最先进的结果,而在机械臂上的部署验证了在混淆多对象组合中进行真实世界抓取的有效迁移。
引用
@article{arxiv.2604.02060,
title = {CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects},
author = {Jingliang Li and Jindou Jia and Tuo An and Chuhao Zhou and Xiangyu Chen and Shilin Shan and Boyu Ma and Bofan Lyu and Gen Li and Jianfei Yang},
journal= {arXiv preprint arXiv:2604.02060},
year = {2026}
}