用于域泛化语义分割的重参数化视觉Transformer (ReVT)
计算机视觉与模式识别
2023-08-28 v1
摘要
语义分割任务要求模型为图像中的每个像素分配语义标签。然而,当此类模型部署在与训练域数据分布不同的未知域时,性能会下降。我们提出了一种基于增强驱动的语义分割域泛化新方法,采用重参数化视觉Transformer (ReVT),并在训练后对多个模型进行权重平均。我们在多个基准数据集上评估了该方法,在常用基准数据集上,小模型取得了47.3%(先前最佳:46.3%)的SOTA mIoU性能,中模型取得了50.1%(先前最佳:47.8%)的SOTA mIoU性能。同时,与最佳先前方法相比,我们的方法所需参数更少且帧率更高。它也容易实现,并且与网络集成不同,在推理时不增加任何计算复杂度。
引用
@article{arxiv.2308.13331,
title = {A Re-Parameterized Vision Transformer (ReVT) for Domain-Generalized Semantic Segmentation},
author = {Jan-Aike Termöhlen and Timo Bartels and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2308.13331},
year = {2023}
}