中文

MR-COSMO:面向查询驱动3D分割的视觉-文本记忆回溯与直接跨模态对齐方法

计算机视觉与模式识别 2025-12-16 v3

摘要

视觉语言模型(VLM)在3D领域的快速发展加速了文本查询引导的点云处理研究,然而现有方法在点级分割上表现不佳,原因是3D-文本对齐不足限制了局部特征与文本上下文的链接。为了解决这一局限性,我们提出了MR-COSMO,一种面向查询驱动3D分割的视觉-文本记忆回溯与直接跨模态对齐方法,通过专用的直接跨模态对齐模块建立3D点云与文本/2D图像数据之间的显式对齐,同时实现带有专用特征库的视觉-文本记忆模块。这种直接对齐机制实现了几何特征和语义特征的精确融合,而记忆模块采用存储文本特征、视觉特征及其对应映射的专用特征库,通过基于注意力的知识回溯动态增强特定场景的表示。在3D指令、参考和语义分割基准上的全面实验验证了其最先进的性能。

关键词

引用

@article{arxiv.2506.20991,
  title  = {MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation},
  author = {Chade Li and Pengju Zhang and Yihong Wu},
  journal= {arXiv preprint arXiv:2506.20991},
  year   = {2025}
}

备注

Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved