中文

Cityscape-Adverse: 通过基于扩散的图像编辑进行真实场景修改以基准测试语义分割的鲁棒性

计算机视觉与模式识别 2024-11-04 v1

摘要

生成式 AI 的最新进展,特别是基于扩散的图像编辑,使得仅使用文本指令即可将图像转换为高度逼真的场景。这项技术为生成多样化合成数据集以评估模型鲁棒性提供了巨大潜力。在本文中,我们引入了 Cityscape-Adverse,一个利用基于扩散的图像编辑模拟八种不利条件的基准,包括天气、光照和季节的变化,同时保留原始语义标签。我们评估了基于扩散的模型生成真实场景修改的可靠性,并评估了最先进的 CNN 和基于 Transformer 的语义分割模型在这些具有挑战性的条件下的性能。此外,我们分析了哪些修改对模型性能影响最大,并探讨了如何在合成数据集上训练以提高在真实不利场景中的鲁棒性。我们的结果表明,所有测试模型,特别是基于 CNN 的架构,在极端条件下经历了显著的性能下降,而基于 Transformer 的模型表现出更强的韧性。我们验证了在 Cityscape-Adverse 上训练的模型在应用于未见域时表现出显著增强的鲁棒性。代码和数据集将发布于 https://github.com/naufalso/cityscape-adverse。

关键词

引用

@article{arxiv.2411.00425,
  title  = {Cityscape-Adverse: Benchmarking Robustness of Semantic Segmentation with Realistic Scene Modifications via Diffusion-Based Image Editing},
  author = {Naufal Suryanto and Andro Aprila Adiputra and Ahmada Yusril Kadiptya and Thi-Thu-Huong Le and Derry Pratama and Yongsu Kim and Howon Kim},
  journal= {arXiv preprint arXiv:2411.00425},
  year   = {2024}
}

备注

19 pages, under review, code and dataset will be available at https://github.com/naufalso/cityscape-adverse