用于开放词汇语义分割的超球空间参数高效微调
计算机视觉与模式识别
2024-12-03 v2
摘要
开放词汇语义分割旨在为图像中每个像素标记任意文本描述。视觉语言基础模型,尤其是 CLIP,最近作为获取开放词汇能力的强大工具。然而,针对 CLIP 进行微调以赋予其像素级预测能力常面临三个问题:1)高计算成本,2)两种内在模态之间的错位,3)在未见类别上的泛化能力下降。为此,我们提出 H-CLIP,一种在超球空间中对两种 CLIP 模态进行对称的参数高效微调(PEFT)策略。具体而言,PEFT 策略通过一系列高效的块对角可学习变换矩阵和一种在所有可学习矩阵之间的双向跨关系通信模块实现。由于 PEFT 策略对两种 CLIP 模态对称实施,两种模态之间的错位得以缓解。此外,我们根据超球能量原理对 CLIP 文本编码器施加额外约束,即在微调期间最小化超球能量可保留原始参数空间的内在结构,从而防止 CLIP 文本编码器所提供的泛化能力被破坏。广泛的评估表明,H-CLIP 在各种基准上实现了新的 SOTA 开放词汇语义分割结果,仅需更新约 4% 的 CLIP 参数即可实现。
引用
@article{arxiv.2405.18840,
title = {Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic Segmentation},
author = {Zelin Peng and Zhengqin Xu and Zhilin Zeng and Yaoming Wang and Wei Shen},
journal= {arXiv preprint arXiv:2405.18840},
year = {2024}
}