中文

通过语义纹理网格中的标签融合改进语义图像分割

计算机视觉与模式识别 2022-02-25 v1

摘要

语义分割模型需要大量人工标注的训练数据,其制作成本高且耗时。为此,我们提出了一种标签融合框架,能够以无监督方式改进视频序列的语义像素标签。我们利用环境的 3D 网格表示,并使用语义网格纹理将不同帧的预测融合为一致表示。使用原始内参和外参相机参数渲染语义网格,得到一组改进的语义分割图像。由于我们优化的 CUDA 实现,我们能够以感知不确定性的方式利用 cc 类上标注的整个 cc 维概率分布。我们在 Scannet 数据集上评估了我们的方法,将最先进分割网络 ESANet 生成的标注从 52.05%52.05 \% 像素准确率提升至 58.25%58.25 \%。我们在线发布了框架的源代码以促进该领域的未来研究(\url{https://github.com/fferflo/semantic-meshes})。据我们所知,这是首个公开可用的基于带语义纹理网格的语义图像分割标签融合框架。

关键词

引用

@article{arxiv.2111.11103,
  title  = {Improving Semantic Image Segmentation via Label Fusion in Semantically Textured Meshes},
  author = {Florian Fervers and Timo Breuer and Gregor Stachowiak and Sebastian Bullinger and Christoph Bodensteiner and Michael Arens},
  journal= {arXiv preprint arXiv:2111.11103},
  year   = {2022}
}