PVUW2024:使用不可靠伪标签的半监督视频语义分割
计算机视觉与模式识别
2024-06-04 v1
摘要
像素级场景理解是计算机视觉的基本问题之一,旨在识别给定图像中每个像素的对象类别、掩码和语义。与图像场景解析相比,视频场景解析引入了时间信息,可以有效提高预测的一致性和准确性,因为现实世界实际上是基于视频的,而非静态状态。在本文中,我们采用了基于不可靠伪标签的半监督视频语义分割方法。然后,我们将教师网络模型与学生网络模型集成,以生成伪标签并重新训练学生网络。我们的方法在开发测试和最终测试中分别达到了 63.71% 和 67.83% 的 mIoU 分数。最终,我们在 CVPR 2024 的自然场景视频场景解析挑战赛中获得了第一名。
引用
@article{arxiv.2406.00587,
title = {Semi-supervised Video Semantic Segmentation Using Unreliable Pseudo Labels for PVUW2024},
author = {Biao Wu and Diankai Zhang and Si Gao and Chengjian Zheng and Shaoli Liu and Ning Wang},
journal= {arXiv preprint arXiv:2406.00587},
year = {2024}
}
备注
Champion Solution for CVPR 2024 PVUW VSS Track. arXiv admin note: text overlap with arXiv:2306.02894