中文

基于 U-Net 的多实例视频对象分割

计算机视觉与模式识别 2019-05-21 v1

摘要

多实例视频对象分割旨在仅给定标注的第一帧的情况下,在像素级别上分割整个视频序列中的特定实例。本文中,我们实现了一个有效的全卷积网络,其建立在 OSVOS 微调层之上的类 U-Net 结构。我们使用实例隔离将该多实例分割问题转化为二值标注问题,并采用加权交叉熵损失与 dice 系数损失作为损失函数。我们的最佳模型在 DAVIS 数据集上取得了 F 均值 0.467 与 J 均值 0.424,与 State-of-the-Art 方法性能相当。但案例分析表明该模型能获得更平滑的轮廓与更好的实例覆盖,意味着其更适用于以召回为导向的分割场景。我们还在其他卷积神经网络(包括 Seg-Net、Mask R-CNN)上进行了实验,并给出了深入的对比与讨论。

关键词

引用

@article{arxiv.1905.07826,
  title  = {U-Net Based Multi-instance Video Object Segmentation},
  author = {Heguang Liu and Jingle Jiang},
  journal= {arXiv preprint arXiv:1905.07826},
  year   = {2019}
}

备注

Stanford cs231n class project