AlignZeg:缓解零样本语义分割中的目标不对齐问题
计算机视觉与模式识别
2024-10-14 v1
摘要
一个严重损害零样本视觉识别性能的问题被称为目标不对齐,即学习目标优先考虑提高已见类的识别准确率,而非未见类,而后者才是真正追求的目标。这个问题在零样本图像分割中变得更加显著,因为更强的(即像素级)监督在已见类和未见类之间带来了更大的差距。为了缓解这一问题,我们提出了一种名为 AlignZeg 的新型架构,该架构对分割流程进行了全面改进,包括提议提取、分类和校正,以更好地契合零样本分割的目标。(1) 互相优化的提议提取。AlignZeg 利用掩码查询与视觉特征之间的交互,促进详细的类无关掩码提议提取。(2) 泛化增强的提议分类。AlignZeg 引入合成数据并结合多个背景原型,以分配更具泛化能力的特征空间。(3) 预测偏差校正。在推理阶段,AlignZeg 使用类指示器寻找潜在的未见类提议,随后进行预测后处理以校正预测偏差。实验表明,AlignZeg 显著增强了零样本语义分割,hIoU 平均提高了 3.8%,主要归因于未见类识别的 7.1% 提升,我们进一步验证了该提升来自于对目标不对齐问题的缓解。
引用
@article{arxiv.2404.05667,
title = {AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation},
author = {Jiannan Ge and Lingxi Xie and Hongtao Xie and Pandeng Li and Xiaopeng Zhang and Yongdong Zhang and Qi Tian},
journal= {arXiv preprint arXiv:2404.05667},
year = {2024}
}