中文

基于 CNN 的模型驱动不精确图匹配用于语义场景理解

计算机视觉与模式识别 2023-08-02 v2

摘要

基于深度学习的语义分割流水线常常忽略训练所用标注图像上可用的结构信息。我们提出了一种新颖的后处理模块,强制施加关于感兴趣对象的结构知识,以改进深度学习给出的分割结果。该模块对应于一种“多对一或零”的不精确图匹配方法,并被表述为一个二次分配问题。我们的方法在两个公开数据集上与基于 CNN 的分割(采用多种 CNN 骨干网络)进行了比较,其中一个用于从 2D RGB 图像进行人脸分割(FASSEG),另一个用于从 3D MRI 进行脑部分割(IBSR)。评估使用了两类结构信息(距离与方向关系,此选择为我们通用框架的一个超参数)。在 FASSEG 数据上,结果表明我们的模块将 CNN 的准确率提升了约 6.3%(Hausdorff 距离从 22.11 降至 20.71)。在 IBSR 数据上,提升达 51%(Hausdorff 距离从 11.01 降至 5.4)。此外,我们的方法对常限制深度学习方法性能的小训练数据集表现出韧性:训练数据集规模越小,提升越大。

关键词

引用

@article{arxiv.2301.07468,
  title  = {Model-based inexact graph matching on top of CNNs for semantic scene understanding},
  author = {Jérémy Chopin and Jean-Baptiste Fasquel and Harold Mouchère and Rozenn Dahyot and Isabelle Bloch},
  journal= {arXiv preprint arXiv:2301.07468},
  year   = {2023}
}

备注

27 pages, 9 figures, 11 tables