CAM-Seg:用于语义图像生成的连续值嵌入方法
计算机视觉与模式识别
2025-03-21 v1 人工智能
摘要
传统的基于变换器的语义分割依赖于量化嵌入。然而,我们的分析表明,使用量化嵌入(如 VQ-VAE)的自编码器在分割掩码上的准确率比连续值嵌入(如 KL-VAE)低 8%。受此启发,我们提出了一种用于语义分割的连续值嵌入框架。通过将语义掩码生成重新表述为连续图像到嵌入的扩散过程,我们的方法消除了对离散潜在表示的需求,同时保留了细粒度的空间和语义细节。我们的关键贡献包括一个扩散引导的自回归变换器,通过建模图像特征中的长程依赖关系来学习连续语义嵌入空间。我们的框架包含一个统一架构,结合了用于连续特征提取的 VAE 编码器、用于条件嵌入生成的扩散引导变换器以及用于语义掩码重建的 VAE 解码器。我们的设置利用嵌入空间的连续性实现了零样本域自适应能力。在多样化数据集(如 Cityscapes 及其域偏移变体)上的实验展示了最先进的分布偏移鲁棒性,包括不利天气条件(如雾、雪)和视角变化。我们的模型还表现出较强的噪声鲁棒性,在高斯噪声、中等运动模糊和中等亮度/对比度变化下实现了稳健性能(相比基线约 95% AP),而在 50% 椒盐噪声、饱和度和色调偏移下仅受到中等影响(相比基线约 90% AP)。代码地址:https://github.com/mahmed10/CAMSS.git
引用
@article{arxiv.2503.15617,
title = {CAM-Seg: A Continuous-valued Embedding Approach for Semantic Image Generation},
author = {Masud Ahmed and Zahid Hasan and Syed Arefinul Haque and Abu Zaher Md Faridee and Sanjay Purushotham and Suya You and Nirmalya Roy},
journal= {arXiv preprint arXiv:2503.15617},
year = {2025}
}