中文

用于可泛化语义分割的原型渐进对齐与重加权

计算机视觉与模式识别 2025-07-17 v1

摘要

可泛化语义分割旨在在未见目标域上表现良好,由于现实应用需要高泛化能力,这是一个关键挑战。类原型代表类中心,由于其稳定性和语义一致性,可作为有利于泛化的域不变线索。然而,该方法面临三个挑战。首先,现有方法通常采用粗略的原型对齐策略,这可能阻碍性能。其次,通过平均源批次特征计算的朴素原型容易过拟合,并可能受到不相关源数据的负面影响。第三,大多数方法同等对待所有源样本,忽略了不同特征具有不同适应难度的事实。为了解决这些局限性,我们提出了一个用于可泛化语义分割的新框架:原型渐进对齐与重加权(PPAR),利用 CLIP 模型的强大泛化能力。具体而言,我们定义了两种原型:原始文本原型(OTP)和视觉文本原型(VTP),通过 CLIP 生成以作为对齐的坚实基础。然后,我们引入了一种渐进对齐策略,以由易到难的方式对齐特征,逐步缩小域差距。此外,我们提出了一种原型重加权机制,估计源数据的可靠性并调整其贡献,减轻不相关或有害特征的影响(即减少负迁移)。我们还提供了理论分析,展示了我们的方法与域泛化理论之间的对齐。跨多个基准的广泛实验表明,PPAR 取得了 SOTA 性能,验证了其有效性。

关键词

引用

@article{arxiv.2507.11955,
  title  = {Prototypical Progressive Alignment and Reweighting for Generalizable Semantic Segmentation},
  author = {Yuhang Zhang and Zhengyu Zhang and Muxin Liao and Shishun Tian and Wenbin Zou and Lu Zhang and Chen Xu},
  journal= {arXiv preprint arXiv:2507.11955},
  year   = {2025}
}

备注

This paper was accepted by IEEE Transactions on Intelligent Transportation Systems