中文

通过Transformer模型聚合在VSPW数据集上进行语义分割

计算机视觉与模式识别 2021-09-06 v1

摘要

语义分割是计算机视觉中的一项重要任务,由此衍生出一些重要应用场景,如自动驾驶、场景解析等。出于对视频语义分割任务的重视,我们参与了本次竞赛。在本报告中,我们简要介绍BetterThing团队在ICCV2021——视频场景解析大赛(Video Scene Parsing in the Wild Challenge)中的解决方案。Transformer被用作提取视频帧特征的主干网络,最终结果为两个Transformer模型SWIN与VOLO输出结果的聚合。该方案取得了57.3%的mIoU,在视频场景解析大赛中排名第三。

关键词

引用

@article{arxiv.2109.01316,
  title  = {Semantic Segmentation on VSPW Dataset through Aggregation of Transformer Models},
  author = {Zixuan Chen and Junhong Zou and Xiaotao Wang},
  journal= {arXiv preprint arXiv:2109.01316},
  year   = {2021}
}