迷失在翻译中?开词汇语义分割中无源域适应的词汇对齐方法
计算机视觉与模式识别
2025-09-30 v3
摘要
我们提出VocAlign,一种专为视觉语言模型在开词汇语义分割中进行无源域适应而设计的新型框架。我们的方法采用增强词汇对齐策略的学生-教师范式,通过引入额外的类别概念来改进伪标签生成。为确保效率,我们使用低秩适应(LoRA)对模型进行微调,在保持其原始能力的同时最小化计算开销。此外,我们为学生模型提出Top-K类别选择机制,在显著降低内存需求的同时进一步提升了适应性能。我们的方法在CityScapes数据集上取得了6.11 mIoU的显著提升,并在零样本分割基准测试中展现出优越性能,为开词汇设置下的无源域适应设立了新标准。
引用
@article{arxiv.2509.15225,
title = {Lost in Translation? Vocabulary Alignment for Source-Free Adaptation in Open-Vocabulary Semantic Segmentation},
author = {Silvio Mazzucco and Carl Persson and Mattia Segu and Pier Luigi Dovesi and Federico Tombari and Luc Van Gool and Matteo Poggi},
journal= {arXiv preprint arXiv:2509.15225},
year = {2025}
}
备注
BMVC 2025 - Project Page: https://thegoodailab.org/blog/vocalign - Code: https://github.com/Sisso16/VocAlign