中文

基于多模型集成的可复用半监督视频场景解析方法

图像与视频处理 2023-06-06 v1

摘要

像素级场景理解是计算机视觉中的基础问题之一,旨在识别给定图像中每个像素的对象类别、掩码与语义。由于真实世界实际上是基于视频而非静态的,学习执行视频语义分割对于实际应用更为合理且实用。在本文中,我们采用 Mask2Former 作为架构、ViT-Adapter 作为骨干网络。然后,我们提出了一种基于多模型集成的可复用半监督训练方法。我们的方法在开发测试和最终测试上分别取得了 62.97% 和 65.83% 的 mIoU 分数。最终,我们在 CVPR 2023 的野外视频场景解析挑战赛中获得第 2 名。

关键词

引用

@article{arxiv.2306.02894,
  title  = {Recyclable Semi-supervised Method Based on Multi-model Ensemble for Video Scene Parsing},
  author = {Biao Wu and Shaoli Liu and Diankai Zhang and Chengjian Zheng and Si Gao and Xiaofeng Zhang and Ning Wang},
  journal= {arXiv preprint arXiv:2306.02894},
  year   = {2023}
}