中文

SJTU:基于坐标检测的多模态模型空间判断以实现统一分割

计算机视觉与模式识别 2026-01-06 v3

摘要

尽管在视觉语言理解方面取得了显著进展,但在多模态架构中实现图像分割仍是现代人工智能系统的根本性挑战。现有的视觉语言模型主要依赖骨干网络或CLIP-based嵌入学习,在细粒度空间定位和操作能力方面存在内在局限性。本文引入SJTU:Spatial Judgments in Multimodal Models - Towards Unified Segmentation through Coordinate Detection(多模态模型中的空间判断——通过坐标检测实现统一分割),该框架利用空间坐标理解来桥接视觉语言交互与精确分割,从而通过自然语言指令实现准确的目标识别。该框架提出了一种通过多模态空间中的空间推理集成分割技术的方法。通过利用归一化坐标检测来获取边界框,并将其转化为可操作的分割输出,我们在多模态架构中建立了空间表征与语言表征之间的联系。实验结果表明,在基准数据集上实现了卓越的性能,在COCO 2017数据集上获得0.5958的IoU分数,在Pascal VOC数据集上获得0.6758的IoU分数。使用单张NVIDIA RTX 3090 GPU进行512x512分辨率图像的测试,平均推理时间为7秒/张,显示该框架在准确性和实际部署方面都具有效果。项目代码可在https://github.com/jw-chae/SJTU获取。

关键词

引用

@article{arxiv.2412.02565,
  title  = {SJTU:Spatial judgments in multimodal models towards unified segmentation through coordinate detection},
  author = {Joongwon Chae and Zhenyu Wang and Peiwu Qin},
  journal= {arXiv preprint arXiv:2412.02565},
  year   = {2026}
}

备注

A flaw was discovered in the experimental setup. Therefore, we are retracting the paper