学习 2D 不变 affordance 知识用于 3D affordance 定位
计算机视觉与模式识别
2026-03-17 v3
摘要
3D 物体 affordance 定位旨在预测 3D 物体上的功能区域,并为机器人领域的广泛应用奠定了基础。最近的进展通过学习 3D 区域与单个人类-物体交互图像之间的映射来解决此问题。然而,3D 物体的几何结构与人类-物体交互图像中的物体并不总是一致的,这导致泛化性差。为解决此问题,我们提出学习来自同一 affordance 类别中多个人类-物体交互图像的通用、不变的 affordance 知识。具体而言,我们引入了 Multi-Image Guided Invariant-Feature-Aware 3D Affordance Grounding (MIFAG) 框架。该框架通过识别多个人类-物体交互图像中常见的交互模式来对 3D 物体 affordance 区域进行定位。首先,Invariant Affordance Knowledge Extraction Module (IAM) 利用迭代更新策略逐步从多个图像中提取对齐的 affordance 知识并将其整合到 affordance 词典中。然后,Affordance Dictionary Adaptive Fusion Module (ADM) 学习考虑多个 affordance 候选者的全面点云表示。此外,构建了 Multi-Image and Point Affordance (MIPA) 基准数据集,并在各种实验比较中证明我们的方法在现有 SOTA 方法方面性能优越。
引用
@article{arxiv.2408.13024,
title = {Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding},
author = {Xianqiang Gao and Pingrui Zhang and Delin Qu and Dong Wang and Zhigang Wang and Yan Ding and Bin Zhao},
journal= {arXiv preprint arXiv:2408.13024},
year = {2026}
}
备注
Accepted by AAAI 2025 (Oral)