MROVSeg:打破视觉语言模型开放词汇图像分割的分辨率诅咒
计算机视觉与模式识别
2024-11-28 v2 人工智能
摘要
预训练的视觉语言模型(VLM),如 CLIP,越来越多地用于在开放词汇和封闭词汇识别之间架起桥梁,实现开放词汇图像分割。由于 VLM 通常使用低分辨率图像(例如 )进行预训练,故此方法大多只针对降采样后的图像进行操作。我们质疑这种设计,因为低分辨率特征往往难以保留细节。典型的解决方案是为高分辨率输入采用额外的图像骨干网络,但这也会引入显著的计算开销。因此,我们提出 MROVSeg,一种针对开放词汇图像分割的多分辨率训练框架,仅使用一个预训练的 CLIP 骨干网络,通过滑动窗口将高分辨率输入切分为与 well-trained 图像编码器输入尺寸相同的均匀小块。其关键组件包括 Multi-Res Adapter,它通过与多分辨率特征相互作用来恢复空间几何结构并把握跨小块的局部-全局对应关系。为实现准确分割,我们引入 Multi-grained Masked Attention 方案,以从多分辨率 CLIP 特征中聚合多层次语义到目标查询。通过全面实验,我们展示了 MROVSeg 在 established 的开放词汇图像分割基准测试上的优越性,确立了开放词汇图像分割的新标准。
引用
@article{arxiv.2408.14776,
title = {MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation},
author = {Yuanbing Zhu and Bingke Zhu and Yingying Chen and Yunfang Niu and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2408.14776},
year = {2024}
}
备注
Technical report