中文

ITACLIP:通过图像、文本与架构增强提升免训练语义分割

计算机视觉与模式识别 2025-04-15 v2

摘要

基础视觉语言模型 的最新进展重塑了计算机视觉任务的评估范式。这些基础模型,尤其是 CLIP,加速了开放词汇计算机视觉任务的研究,包括开放词汇语义分割。尽管初步结果令人鼓舞,但 VLM 的密集预测能力仍需进一步提升。在本研究中,我们通过引入新模块和修改来增强 CLIP 的语义分割性能:1) ViT 最后一层的架构更改,以及将中间层的注意力图与最后一层相结合;2) 图像工程:应用数据增强以丰富输入图像表示;3) 使用大型语言模型 为每个类名生成定义和同义词,以利用 CLIP 的开放词汇能力。我们的免训练方法 ITACLIP 在诸如 COCO-Stuff、COCO-Object、Pascal Context 和 Pascal VOC 等分割基准上优于当前最先进的方法。我们的代码可在 https://github.com/m-arda-aydn/ITACLIP 获取。

关键词

引用

@article{arxiv.2411.12044,
  title  = {ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements},
  author = {M. Arda Aydın and Efe Mert Çırpar and Elvin Abdinli and Gozde Unal and Yusuf H. Sahin},
  journal= {arXiv preprint arXiv:2411.12044},
  year   = {2025}
}