中文

用于语义分割的区域互信息损失

计算机视觉与模式识别 2019-10-29 v1

摘要

语义分割是计算机视觉中的基本问题。实践中它被视为逐像素分类问题,多数分割模型使用逐像素损失作为优化准则。然而,逐像素损失忽略了图像中像素间的依赖关系。已有若干利用像素间关系的方法被研究,例如条件随机场(CRF)和基于像素亲和力的办法。但这些方法通常需要额外的模型分支、大量额外内存或更多推理时间。本文提出一种区域互信息(RMI)损失,以更简单高效地建模像素间依赖。与将像素视为独立样本的逐像素损失不同,RMI 使用一个像素及其邻域像素来表示该像素。于是对于图像中每个像素,我们得到一个编码像素间关系的多维点,图像被转化为这些高维点的多维分布。预测与真值因而可通过最大化其多维分布间的互信息(MI)来实现高阶一致性。此外,由于 MI 的实际值难以计算,我们推导了 MI 的下界并最大化该下界以最大化 MI 真实值。RMI 仅在训练阶段需要少量额外计算资源,测试时无开销。实验结果表明,RMI 在 PASCAL VOC 2012 和 CamVid 数据集上能取得显著且一致的性能提升。代码见 https://github.com/ZJULearning/RMI。

关键词

引用

@article{arxiv.1910.12037,
  title  = {Region Mutual Information Loss for Semantic Segmentation},
  author = {Shuai Zhao and Yang Wang and Zheng Yang and Deng Cai},
  journal= {arXiv preprint arXiv:1910.12037},
  year   = {2019}
}