AffordMatcher: 基于视觉信号器的 3D 场景触感学习
计算机视觉与模式识别
2026-03-31 v1
摘要
触感学习是许多应用中的复杂挑战,现有方法主要关注对象的几何结构、视觉知识和触感标签以确定可交互区域。然而,将这种学习能力扩展到场景中要复杂得多,因为难以融合对象级和场景级语义。本文引入了 AffordBridge,一个大型数据集,包含 685 个高分辨率室内场景中 291,637 项功能交互标注,标注形式为点云。我们的触感标注还伴随与场景中相同实例关联的 RGB 图像。基于我们的数据集,我们提出了 AffordMatcher,一种触感学习方法,通过在基于图像的实例和基于点云的实例之间建立连贯的语义对应来实现关键点匹配,从而基于称为视觉信号器的线索实现更精确的触感区域识别。我们的数据集实验结果表明,我们的方法在其他方法之上具有有效性。
引用
@article{arxiv.2603.27970,
title = {AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers},
author = {Nghia Vu and Tuong Do and Khang Nguyen and Baoru Huang and Nhat Le and Binh Xuan Nguyen and Erman Tjiputra and Quang D. Tran and Ravi Prakash and Te-Chuan Chiu and Anh Nguyen},
journal= {arXiv preprint arXiv:2603.27970},
year = {2026}
}
备注
14 pages. Accepted to CVPR 2026