基于原型语义与几何对齐的part-aware 开放词汇3D功能对齐
计算机视觉与模式识别
2026-03-19 v1
摘要
将自然语言问题对准3D对象中功能相关区域的任务,称为语言驱动的3D功能对齐,对具身智能和人机交互至关重要。现有方法虽然从基于标签的方法发展到语言驱动方法,但仍面临开放词汇泛化、细粒度几何对齐和part级语义一致性等挑战。为此,我们提出了一种新型两阶段跨模态框架,用于增强语义和几何表示以实现开放词汇3D功能对齐。在第一阶段,大语言模型生成part-aware指令以恢复缺失的语义,从而使模型能够链接相似的功能。第二阶段,我们引入两个关键组件:Affordance Prototype Aggregation (APA),用于捕捉每种功能在跨对象的几何一致性;以及Intra-Object Relational Modeling (IORM),用于在对象内部细化几何差异以支持精确的语义对齐。我们通过在新引入的基准测试上以及两个现有基准测试上的大量实验验证了该方法的有效性,显示出优于现有方法的优异性能。
关键词
引用
@article{arxiv.2603.17647,
title = {Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment},
author = {Dongqiang Gou and Xuming He},
journal= {arXiv preprint arXiv:2603.17647},
year = {2026}
}