ITACLIP:通过图像、文本与架构增强提升免训练语义分割
计算机视觉与模式识别
2025-04-15 v2
摘要
基础视觉语言模型 的最新进展重塑了计算机视觉任务的评估范式。这些基础模型,尤其是 CLIP,加速了开放词汇计算机视觉任务的研究,包括开放词汇语义分割。尽管初步结果令人鼓舞,但 VLM 的密集预测能力仍需进一步提升。在本研究中,我们通过引入新模块和修改来增强 CLIP 的语义分割性能:1) ViT 最后一层的架构更改,以及将中间层的注意力图与最后一层相结合;2) 图像工程:应用数据增强以丰富输入图像表示;3) 使用大型语言模型 为每个类名生成定义和同义词,以利用 CLIP 的开放词汇能力。我们的免训练方法 ITACLIP 在诸如 COCO-Stuff、COCO-Object、Pascal Context 和 Pascal VOC 等分割基准上优于当前最先进的方法。我们的代码可在 https://github.com/m-arda-aydn/ITACLIP 获取。
引用
@article{arxiv.2411.12044,
title = {ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements},
author = {M. Arda Aydın and Efe Mert Çırpar and Elvin Abdinli and Gozde Unal and Yusuf H. Sahin},
journal= {arXiv preprint arXiv:2411.12044},
year = {2025}
}