基于多模型集成的可复用半监督视频场景解析方法
图像与视频处理
2023-06-06 v1
摘要
像素级场景理解是计算机视觉中的基础问题之一,旨在识别给定图像中每个像素的对象类别、掩码与语义。由于真实世界实际上是基于视频而非静态的,学习执行视频语义分割对于实际应用更为合理且实用。在本文中,我们采用 Mask2Former 作为架构、ViT-Adapter 作为骨干网络。然后,我们提出了一种基于多模型集成的可复用半监督训练方法。我们的方法在开发测试和最终测试上分别取得了 62.97% 和 65.83% 的 mIoU 分数。最终,我们在 CVPR 2023 的野外视频场景解析挑战赛中获得第 2 名。
引用
@article{arxiv.2306.02894,
title = {Recyclable Semi-supervised Method Based on Multi-model Ensemble for Video Scene Parsing},
author = {Biao Wu and Shaoli Liu and Diankai Zhang and Chengjian Zheng and Si Gao and Xiaofeng Zhang and Ning Wang},
journal= {arXiv preprint arXiv:2306.02894},
year = {2023}
}