基于视觉 Transformer 的 RGB-D 语义分割无源域自适应方法
计算机视觉与模式识别
2023-12-07 v2 多媒体
摘要
随着深度传感器可用性的增加,结合颜色信息与深度数据的多模态框架正受到关注。然而,语义分割的 ground truth 数据难以提供,因此使域自适应成为一个重要的研究领域。但大多数域自适应方法无法有效处理多模态数据。具体而言,我们解决了具有挑战性的无源域自适应设定,其中自适应在不复用源数据的情况下进行。我们提出 MISFIT:多模态无源信息融合 Transformer,一种深度感知框架,它在多个阶段(即输入、特征和输出层级)将深度数据注入基于视觉 Transformer 的分割模块。颜色与深度风格迁移有助于早期阶段的域对齐,而在模态间重新连接自注意力可创建混合特征,从而允许提取更好的语义内容。此外,还提出了一种基于深度的熵最小化策略,以自适应地加权不同距离的区域。我们的框架也是首个将 RGB-D 视觉 Transformer 用于无源语义分割的方法,相对于标准策略展现出显著的性能提升。
引用
@article{arxiv.2305.14269,
title = {Source-Free Domain Adaptation for RGB-D Semantic Segmentation with Vision Transformers},
author = {Giulia Rizzoli and Donald Shenaj and Pietro Zanuttigh},
journal= {arXiv preprint arXiv:2305.14269},
year = {2023}
}
备注
WACV 2024, 2nd Workshop on Pretraining (WACVW)