中文

用于域泛化语义分割的重参数化视觉Transformer (ReVT)

计算机视觉与模式识别 2023-08-28 v1

摘要

语义分割任务要求模型为图像中的每个像素分配语义标签。然而,当此类模型部署在与训练域数据分布不同的未知域时,性能会下降。我们提出了一种基于增强驱动的语义分割域泛化新方法,采用重参数化视觉Transformer (ReVT),并在训练后对多个模型进行权重平均。我们在多个基准数据集上评估了该方法,在常用基准数据集上,小模型取得了47.3%(先前最佳:46.3%)的SOTA mIoU性能,中模型取得了50.1%(先前最佳:47.8%)的SOTA mIoU性能。同时,与最佳先前方法相比,我们的方法所需参数更少且帧率更高。它也容易实现,并且与网络集成不同,在推理时不增加任何计算复杂度。

关键词

引用

@article{arxiv.2308.13331,
  title  = {A Re-Parameterized Vision Transformer (ReVT) for Domain-Generalized Semantic Segmentation},
  author = {Jan-Aike Termöhlen and Timo Bartels and Tim Fingscheidt},
  journal= {arXiv preprint arXiv:2308.13331},
  year   = {2023}
}