基于核预测网络的数据标签翻译用于语义分割
计算机视觉与模式识别
2025-07-14 v1
摘要
语义分割依赖大量稠密像素级标注才能获得最佳性能,但由于难以获得真实数据的准确标注,实践者往往在大规模合成数据集上进行训练。无配对图像翻译是一种方法,旨在生成更真实的训练数据,以应对数据不足的情形。当前的无配对图像翻译方法训练生成对抗网络(GAN)进行翻译,并通过循环一致性来强制像素级语义匹配。但这些方法无法保证语义匹配成立,这会给依赖噪声像素标签的语义分割任务带来挑战。我们提出了一种新颖的图像翻译方法——域对抗核预测网络(DA-KPN),其保证了合成标签与翻译结果之间的语义匹配。DA-KPN估计像素级输入转换参数,以轻量且简单的翻译函数实现翻译。为确保像素级转换的真实性,DA-KPN采用多尺度判别器来区分翻译后的样本与目标样本。我们展示了DA-KPN在语义分割的合成到真实基准测试中优于以往基于GAN的方法,且在人脸解析任务上性能相当。
引用
@article{arxiv.2507.08554,
title = {Image Translation with Kernel Prediction Networks for Semantic Segmentation},
author = {Cristina Mata and Michael S. Ryoo and Henrik Turbell},
journal= {arXiv preprint arXiv:2507.08554},
year = {2025}
}
备注
OOD-CV Workshop at ECCV 2024