基于文本查询驱动的掩码变换器用于域生成化语义分割
计算机视觉与模式识别
2024-08-01 v2
摘要
本文提出一种方法,用于解决域生成化语义分割问题,利用来自视觉语言模型文本嵌入中的域不变语义知识。我们将文本嵌入作为基于变换器的分割框架中的对象查询(文本对象查询)。这些查询被视为域生成化分割中像素分组的域不变基准。为了充分利用文本对象查询的潜力,我们引入了一种名为文本查询驱动掩码变换器(tqdm)的新型框架。我们的tqdm旨在(1)生成最大化编码域不变语义的文本对象查询,(2)增强密集视觉特征的语义清晰度。此外,我们提出了三个正则化损失,以通过在视觉特征和文本特征之间进行对齐来提高tqdm的效果。通过我们的方法,模型能够理解感兴趣类别的内在语义信息,从而能够对极端域(例如素描风格)进行泛化。我们的tqdm在GTA5→Cityscapes上实现了68.9 mIoU,超越了以前的领先方法约2.5 mIoU。项目页面可在https://byeonghyunpak.github.io/tqdm访问。
引用
@article{arxiv.2407.09033,
title = {Textual Query-Driven Mask Transformer for Domain Generalized Segmentation},
author = {Byeonghyun Pak and Byeongju Woo and Sunghwan Kim and Dae-hwan Kim and Hoseong Kim},
journal= {arXiv preprint arXiv:2407.09033},
year = {2024}
}
备注
ECCV 2024