Web 视频中主动区域的帧间聚合用于弱监督语义分割
计算机视觉与模式识别
2019-08-14 v1
摘要
当深度神经网络仅在图像级标注数据上训练时,每幅图像中激活的区域往往只识别出目标物体的一小块区域。我们提出一种利用从网络自动采集的视频、借助静态图像所不具备的时间信息来识别目标物体更大区域的方法。视频中的时间变化使得目标物体的不同区域得以被激活。我们获取视频每帧中的激活区域,然后使用基于光流的扭曲技术将连续帧的区域聚合为单幅图像。所得定位图覆盖了目标物体的更多部分,并可作为代理真值来训练分割网络。这一简单方法在相同监督水平下优于现有方法,甚至优于依赖额外标注的方法。基于 VGG-16 与 ResNet 101 骨干网络,我们的方法在 PASCAL VOC 2012 测试图像上分别取得了 65.0 与 67.4 的 mIoU,达到了新的 state-of-the-art。
引用
@article{arxiv.1908.04501,
title = {Frame-to-Frame Aggregation of Active Regions in Web Videos for Weakly Supervised Semantic Segmentation},
author = {Jungbeom Lee and Eunji Kim and Sungmin Lee and Jangho Lee and Sungroh Yoon},
journal= {arXiv preprint arXiv:1908.04501},
year = {2019}
}
备注
ICCV 2019