先融合后蒸馏:面向跨模态正蒸馏的域自适应3D语义分割
计算机视觉与模式识别
2024-10-28 v1
摘要
在跨模态无监督域自适应中,使用源域数据(例如合成数据)训练的模型被适应到目标域数据(例如真实世界数据),而无需访问目标标注。以往方法试图在每个域中相互模仿跨模态输出,从而强制实现不同域中类概率分布的一致性。然而,它们忽略了跨模态学习中异构融合带来的互补性。鉴于此,我们提出了一种新颖的融合后蒸馏(FtD++)方法,以探索源域和目标域的跨模态正蒸馏,用于3D语义分割。FtD++不仅实现了2D图像和3D点云输出之间的分布一致性,还实现了源域和增强域之间的一致性。具体而言,我们的方法包含三个关键要素。首先,我们提出了一个模型无关的特征融合模块,以生成跨模态融合表示,用于建立潜在空间。在该空间中,两种模态被强制实现最大相关性和互补性。其次,所提出的跨模态正蒸馏保留了多模态输入的完整信息,并将源域的语义内容与目标域的风格相结合,从而实现域-模态对齐。最后,我们设计了跨模态去偏伪标签方法,通过自训练方式对伪标签的不确定性进行建模。大量实验表明,在无监督和半监督设置下的多个域自适应场景中,我们的方法达到了最先进的性能。代码可在https://github.com/Barcaaaa/FtD-PlusPlus获取。
关键词
引用
@article{arxiv.2410.19446,
title = {Fusion-then-Distillation: Toward Cross-modal Positive Distillation for Domain Adaptive 3D Semantic Segmentation},
author = {Yao Wu and Mingwei Xing and Yachao Zhang and Yuan Xie and Yanyun Qu},
journal= {arXiv preprint arXiv:2410.19446},
year = {2024}
}