与 DINO 对话:桥接自监督视觉主干网络与语言模型以实现开放词汇分割
计算机视觉与模式识别
2025-09-17 v3 人工智能
计算与语言
摘要
开放词汇分割(Open-Vocabulary Segmentation, OVS)旨在通过自由形式的文本概念对图像进行分割,而无需预定义的训练类别。虽然现有的视觉语言模型如 CLIP 可通过利用视觉Transformer获得的粗糙空间信息来生成分割掩码,但由于其对图像和文本特征的全局对齐,面临空间局化挑战。相反,类似 DINO 这样的自监督视觉模型在细粒度视觉编码方面表现出色,但缺乏与语言的集成。为填补这一差距,我们提出了 Talk2DINO,一种新型的混合方法,将 DINOv2 的空间精度与 CLIP 的语言理解能力相结合。我们的做法通过一种学习到的映射函数,将 CLIP 的文本嵌入对齐到 DINOv2 的 patch 级别特征上,无需对底层主干网络进行微调。在训练时,我们利用 DINOv2 的注意力图,对局部视觉 patch 与文本嵌入进行选择性对齐。我们表明,Talk2DINO 的强大语义和定位能力可增强分割过程,实现更自然、更少噪声的分割效果,并且该方法还能有效区分前景对象与背景。实验结果表明,Talk2DINO 在多个无监督 OVS 基准测试中实现了最先进的性能。源码和模型已公开发布于:https://lorebianchi98.github.io/Talk2DINO/。
引用
@article{arxiv.2411.19331,
title = {Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation},
author = {Luca Barsellotti and Lorenzo Bianchi and Nicola Messina and Fabio Carrara and Marcella Cornia and Lorenzo Baraldi and Fabrizio Falchi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2411.19331},
year = {2025}
}
备注
ICCV 2025