中文

基于形态学优化对抗语义分割中不可行包含关系的数据驱动方法

计算机视觉与模式识别 2025-12-02 v7

摘要

最先进的语义分割模型通常以数据驱动的方式进行优化,仅在其训练数据上最小化逐像素或逐片段的分类目标。这种纯粹的数据驱动范式常常导致荒谬的分割结果,尤其是当输入图像的领域与训练时遇到的领域发生偏移时。例如,最先进的模型可能会将“道路”标签分配给一个被另一个分别标记为“天空”的片段所包含的片段。然而,现有数据集的真实标注表明这种包含关系是不可行的。我们的方法,不可行语义包含(InSeIn),首先以离线、数据驱动的方式从手头的语义分割训练集中提取控制空间类别关系的显式包含约束,然后在训练过程中强制执行一个形态学且可微的损失函数,惩罚对这些约束的违反,以促进预测的可行性。InSeIn 是一种轻量级的即插即用方法,是朝着最小化学习分割模型预测中不可行语义包含迈出的新颖一步,并在 ADE20K、Cityscapes 和 ACDC 数据集上,相对于各种最先进的网络,取得了一致且显著的性能提升。https://github.com/SHAMIK-97/InSeIn

关键词

引用

@article{arxiv.2408.14672,
  title  = {Optimizing against Infeasible Inclusions from Data for Semantic Segmentation through Morphology},
  author = {Shamik Basu and Luc Van Gool and Christos Sakaridis},
  journal= {arXiv preprint arXiv:2408.14672},
  year   = {2025}
}

备注

Published in 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)