基于 2D 语义知识的 3D 功能分割解锁
计算机视觉与模式识别
2026-03-20 v3
摘要
功能分割旨在将 3D 对象分解为具有不同功能角色的部件,使模型能够对对象交互进行推理,而不仅仅是识别。现有方法大多遵循 3D 语义分割或基于提示的框架范式,在几何线索较弱或模糊时难以工作,因为稀疏点云提供的功能信息有限。为克服这一局限,我们利用大规模 2D 视觉基础模型 (Vision Foundation Models, VFMs) 中嵌入的丰富语义知识,通过跨模态对齐机制引导 3D 表示学习。具体我们提出了跨模态亲和力转移 (Cross-Modal Affinity Transfer, CMAT),一种预训练策略,迫使 3D 编码器与通过提升 2D 特征所诱导的语义结构对齐。CMAT 由核心亲和力对齐目标驱动,辅以几何重建和特征多样性两个辅助损失,共同鼓励结构化且具辨识力的特征学习。在基于 CMAT 预训练的主干网络上,我们采用轻量级功能分割器,通过高效的跨注意力界面将文本或视觉提示注入所学 3D 空间,从而实现稠密且感知提示的功能预测,同时保持预训练期间建立的语义组织。广泛实验表明,我们的方法在准确率和效率方面均显著优于先前的状态方法。
引用
@article{arxiv.2510.08316,
title = {Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge},
author = {Yu Huang and Zelin Peng and Changsong Wen and Xiaokang Yang and Wei Shen},
journal= {arXiv preprint arXiv:2510.08316},
year = {2026}
}
备注
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition