基于扩散模型的风格迁移:用于合成到真实域适应
计算机视觉与模式识别
2025-09-19 v2 机器学习
摘要
在合成数据上训练的语义分割模型由于域差异,尤其是在标注数据稀缺的恶劣条件下,往往在真实图像上的表现较差。然而,近期的基础模型能够在没有任何训练的情况下生成逼真的图像。本文提出利用此类扩散模型来提高在合成数据上学习的视觉模型性能。我们引入两种基于扩散模型的语义一致风格迁移技术:基于类的自适应实例归一化和交叉注意力(CACTI)及其基于选择性注意力过滤的扩展(CACTIF)。CACTI 根据语义类别有选择地应用统计归一化,而 CACTIF 进一步基于特征相似性过滤交叉注意力图,从而防止在注意力对应关系较弱的区域出现伪影。我们的技术在保持语义边界和结构一致性方面优于应用全局变换或在无约束条件下生成内容的方法。使用 GTA5 作为源域,Cityscapes/ACDC 作为目标域的实验表明,我们的方法在 FID 分数更低、内容保留更好的条件下产生更高质量的图像。我们的工作表明,类感知的扩散模型风格迁移能够在最小化目标域数据的情况下有效弥合合成到真实的域差异,推动面向挑战性真实场景的鲁棒感知系统的发展。源码可在 https://github.com/echigot/cactif 获取。
引用
@article{arxiv.2505.16360,
title = {Style Transfer with Diffusion Models for Synthetic-to-Real Domain Adaptation},
author = {Estelle Chigot and Dennis G. Wilson and Meriem Ghrib and Thomas Oberlin},
journal= {arXiv preprint arXiv:2505.16360},
year = {2025}
}
备注
Published in Computer Vision and Image Understanding, September 2025 (CVIU 2025)