中文

HGFormer:用于域泛化语义分割的分层分组 Transformer

计算机视觉与模式识别 2023-05-23 v1

摘要

当前的语义分割模型在独立同分布(i.i.d.)条件下取得了巨大成功。然而,在实际应用中,测试数据可能来自与训练数据不同的域。因此,提升模型对域差异的鲁棒性十分重要。本工作研究域泛化设置下的语义分割,其中模型仅在源域上训练并在未见目标域上测试。已有工作表明 Vision Transformers 比 CNN 更鲁棒,并指出这与自注意力的视觉分组特性有关。本工作中,我们提出一种新颖的分层分组 Transformer(HGFormer),显式地将像素分组以形成部件级掩码,进而形成整体级掩码。不同尺度的掩码旨在分割出类别的部件与整体。HGFormer 结合两个尺度的掩码分类结果进行类别标签预测。我们利用七个公开语义分割数据集组装了多种有趣的跨域设置。实验表明,HGFormer 比逐像素分类方法和扁平分组 Transformer 产生了更鲁棒的语义分割结果,并显著优于先前方法。代码将发布于 https://github.com/dingjiansw101/HGFormer。

关键词

引用

@article{arxiv.2305.13031,
  title  = {HGFormer: Hierarchical Grouping Transformer for Domain Generalized Semantic Segmentation},
  author = {Jian Ding and Nan Xue and Gui-Song Xia and Bernt Schiele and Dengxin Dai},
  journal= {arXiv preprint arXiv:2305.13031},
  year   = {2023}
}

备注

Accepted by CVPR 2023