TMT:基于区域自适应转移性估计的跨域语义分割
计算机视觉与模式识别
2025-10-16 v3 人工智能
摘要
近期的Vision Transformer(ViT)技术显著提升了语义分割性能,但其在新目标域的适应仍受分布迁移的挑战,常常破坏全局注意力机制。虽然现有的全局和patch级适应方法提供了一些改进,但忽略了不同图像区域内固有的空间变异转移性。为此,我们提出了Transferable Mask Transformer(TMT),一个面向跨域表示学习的区域自适应框架,通过转移性指导实现性能提升。首先,我们动态地将图像划分为由结构和语义相似性组成的连贯区域,并在局部水平估计其域转移性。随后,我们将区域级别的转移性图直接融入ViT的自注意力机制中,使模型能够针对转移性较差且语义不确定性较高的区域自适应地聚焦注意力。广泛的跨域实验表明,TMT不仅能缓解因域迁移导致的性能下降,还能持续地超过现有方法。
引用
@article{arxiv.2504.05774,
title = {TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability Estimation},
author = {Enming Zhang and Zhengyu Li and Yanru Wu and Jingge Wang and Yang Tan and Guan Wang and Yang Li and Xiaoping Zhang},
journal= {arXiv preprint arXiv:2504.05774},
year = {2025}
}