利用视觉基础模型实现高性能、免训练的开放词汇分割
计算机视觉与模式识别
2024-11-15 v1
摘要
尽管对比语言-图像预训练(CLIP)推进了开放词汇预测,其在语义分割上的性能仍不理想。这一不足主要源于其空间不变语义特征与有限的分辨率。尽管先前的改进方法通过修改 CLIP 图像编码器中的自注意力机制解决了空间不变语义问题,但分辨率受限的问题仍未被探索。与先前通过滑动窗口对子图像进行分割再拼接结果的“先分割后拼接”方法不同,我们引入了一种“先拼接后分割”范式,结合 Segment-Anything Model(SAM)来解决分辨率问题,因为 SAM 擅长从高分辨率图像中提取细粒度的语义相关性。具体而言,我们提出了 Trident,一个免训练框架,它首先拼接由 CLIP 和 DINO 从子图像中提取的特征,随后利用 SAM 的编码器创建用于全局聚合的相关性矩阵,从而拓宽有效分割的感受野。此外,我们提出了一种针对 CLIP 粗分割输出的优化策略,将其转化为 SAM 的提示,进一步提升了分割性能。与当前 SOTA 相比,Trident 在八个基准测试上的 mIoU 取得了显著提升,从 44.4 提高到了 48.6。代码可在 https://github.com/YuHengsss/Trident 获取。
引用
@article{arxiv.2411.09219,
title = {Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation},
author = {Yuheng Shi and Minjing Dong and Chang Xu},
journal= {arXiv preprint arXiv:2411.09219},
year = {2024}
}
备注
12 pages, 5 figures