基于 U-Net 的多实例视频对象分割
计算机视觉与模式识别
2019-05-21 v1
摘要
多实例视频对象分割旨在仅给定标注的第一帧的情况下,在像素级别上分割整个视频序列中的特定实例。本文中,我们实现了一个有效的全卷积网络,其建立在 OSVOS 微调层之上的类 U-Net 结构。我们使用实例隔离将该多实例分割问题转化为二值标注问题,并采用加权交叉熵损失与 dice 系数损失作为损失函数。我们的最佳模型在 DAVIS 数据集上取得了 F 均值 0.467 与 J 均值 0.424,与 State-of-the-Art 方法性能相当。但案例分析表明该模型能获得更平滑的轮廓与更好的实例覆盖,意味着其更适用于以召回为导向的分割场景。我们还在其他卷积神经网络(包括 Seg-Net、Mask R-CNN)上进行了实验,并给出了深入的对比与讨论。
引用
@article{arxiv.1905.07826,
title = {U-Net Based Multi-instance Video Object Segmentation},
author = {Heguang Liu and Jingle Jiang},
journal= {arXiv preprint arXiv:1905.07826},
year = {2019}
}
备注
Stanford cs231n class project