语言引导的域泛化分割简明方法
计算机视觉与模式识别
2024-04-03 v2
摘要
泛化到训练时未见过的新域是神经网络部署于真实应用中的长期挑战之一。现有泛化技术要么需要外部图像用于增强,要么旨在通过施加各种对齐约束学习不变表示。大规模预训练近期展现出有前景的泛化能力,以及绑定不同模态的潜力。例如,CLIP 等视觉-语言模型的出现为视觉模型利用文本模态打开了大门。本文中,我们引入一种通过以语言作为随机化来源来泛化语义分割网络的简单框架。我们的方法包含三个关键要素:(i)通过最小微调保留 CLIP 固有鲁棒性,(ii)语言驱动的局部风格增强,以及(iii)训练时通过局部混合源风格与增强风格进行随机化。大量实验在各种泛化基准上报告了最先进结果。代码见 https://github.com/astra-vision/FAMix。
引用
@article{arxiv.2311.17922,
title = {A Simple Recipe for Language-guided Domain Generalized Segmentation},
author = {Mohammad Fahes and Tuan-Hung Vu and Andrei Bursuc and Patrick Pérez and Raoul de Charette},
journal= {arXiv preprint arXiv:2311.17922},
year = {2024}
}
备注
CVPR 2024