点语言学家模型:通过桥接大型3D-语言模型分割任意对象
计算机视觉与模式识别
2026-02-20 v2
摘要
基于大型语言模型(LLM)的3D对象分割因其广泛的语义、任务灵活性和强大的泛化能力而成为一种主流范式。然而,该范式受到表示不对齐的阻碍:LLM处理高层语义标记,而3D点云仅传达密集的几何结构。在先前的方法中,不对齐限制了输入和输出。在输入阶段,密集的点块需要大量的预对齐,削弱了对象级语义并混淆了相似的干扰物。在输出阶段,预测仅依赖于密集特征,缺乏显式的几何线索,导致细粒度精度的损失。为解决这些限制,我们提出了点语言学家模型(PLM),一个通用框架,弥合了LLM与密集3D点云之间的表示差距,无需3D文本或3D图像之间的大规模预对齐。具体而言,我们引入了以对象为中心的判别表示(OcDR),该表示在硬负样本感知的训练目标下学习捕获目标语义和场景关系的以对象为中心的标记。这缓解了LLM标记与3D点之间的不对齐,增强了对干扰物的鲁棒性,并促进了LLM内的语义级推理。为实现精确分割,我们引入了几何重激活解码器(GRD),该解码器通过将携带LLM推断几何信息的OcDR标记与相应的密集特征相结合来预测掩码,从而在整个流程中保留全面的密集特征。大量实验表明,PLM在ScanNetv2上实现了+7.3 mIoU、在Multi3DRefer上实现了+6.0 mIoU的显著改进,用于3D指称分割,并在涵盖4个不同任务的7个基准上取得了一致的提升,证明了全面的以对象为中心的推理对于稳健的3D理解的有效性。
引用
@article{arxiv.2509.07825,
title = {Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model},
author = {Zhuoxu Huang and Mingqi Gao and Jungong Han},
journal= {arXiv preprint arXiv:2509.07825},
year = {2026}
}
备注
Accepted by IEEE Transactions on Multimedia (TMM)