中文

TIGaussian:解耦高斯体以实现空间感知的文本-图像-3D对齐

计算机视觉与模式识别 2026-01-28 v1

摘要

虽然视觉-语言模型已经深刻地连接了文本和图像之间的特征,但3D模态数据(如点云和3D高斯体)的融入,进一步使得针对3D相关任务(例如跨模态检索、零样本分类和场景识别)的预训练成为可能。由于在提取3D模态特征和弥合不同模态之间的差距方面仍然存在挑战,我们提出了TIGaussian,这是一个利用3D高斯泼溅特性,通过多分支3D高斯泼溅分词器和模态特定3D特征对齐策略来加强跨模态对齐的框架。具体来说,我们的多分支3D高斯泼溅分词器将3D高斯泼溅结构的内在属性解耦为紧凑的潜在表示,从而实现更具泛化性的特征提取。为了进一步弥合模态差距,我们开发了双向跨模态对齐策略:一种多视角特征融合机制,利用扩散先验来解决图像-3D对齐中的视角模糊性;同时,一个文本-3D投影模块自适应地将3D特征映射到文本嵌入空间,以实现更好的文本-3D对齐。在多个数据集上的大量实验证明了TIGaussian在多项任务中的最先进性能。

关键词

引用

@article{arxiv.2601.19247,
  title  = {TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment},
  author = {Jiarun Liu and Qifeng Chen and Yiru Zhao and Minghua Liu and Baorui Ma and Sheng Yang},
  journal= {arXiv preprint arXiv:2601.19247},
  year   = {2026}
}