WeClick:基于点击标注的弱监督视频语义分割
计算机视觉与模式识别
2021-08-05 v2 人工智能
多媒体
摘要
与繁琐的逐像素掩码标注相比,通过点击标注数据要容易得多,对一幅图像仅需数秒。然而,将点击应用于学习视频语义分割模型此前尚未被探索。本工作中,我们提出一种有效的基于点击标注的弱监督视频语义分割流程,称为 WeClick,通过仅单次点击分割语义类的一个实例来节省费力标注工作。由于点击未捕获详细的语义信息,直接使用点击标签训练会导致较差的分割预测。为缓解该问题,我们设计了一种新颖的记忆流知识蒸馏策略,利用丰富无标签视频帧中的时间信息(称为记忆流),通过估计运动将邻近预测蒸馏到目标帧。此外,我们采用普通知识蒸馏进行模型压缩。在此情况下,WeClick 在训练阶段以低成本点击标注学习紧凑的视频语义分割模型,而在推理阶段实现实时且准确的模型。在 Cityscapes 和 Camvid 上的实验结果表明,WeClick 优于最先进方法,比基线提升 10.24% mIoU,并实现实时执行。
引用
@article{arxiv.2107.03088,
title = {WeClick: Weakly-Supervised Video Semantic Segmentation with Click Annotations},
author = {Peidong Liu and Zibin He and Xiyu Yan and Yong Jiang and Shutao Xia and Feng Zheng and Maowei Hu},
journal= {arXiv preprint arXiv:2107.03088},
year = {2021}
}
备注
Accepted by ACM MM2021 Oral