中文

TBN-ViT:基于视觉Transformer的时序双边网络用于视频场景解析

计算机视觉与模式识别 2021-12-03 v1

摘要

在复杂多样场景下进行的视频场景解析是一项具有挑战性且意义重大任务,尤其在自动驾驶技术快速发展的背景下。Video Scene Parsing in the Wild (VSPW) 数据集包含经过精细裁剪的长时间、密集标注和高分辨率视频片段。基于 VSPW,我们设计了一种结合视觉Transformer的时序双边网络。我们首先设计了一条基于卷积的空间路径以生成能够保留空间信息的低层特征。同时,采用带有视觉Transformer的上下文路径来获取充足的上下文信息。此外,设计了一个时序上下文模块以利用帧间的上下文信息。最终,所提方法在 VSPW2021 Challenge 测试数据集上取得了 49.85% 的平均交并比(mIoU)。

关键词

引用

@article{arxiv.2112.01033,
  title  = {TBN-ViT: Temporal Bilateral Network with Vision Transformer for Video Scene Parsing},
  author = {Bo Yan and Leilei Cao and Hongbin Wang},
  journal= {arXiv preprint arXiv:2112.01033},
  year   = {2021}
}

备注

The sixth place solution for ICCV2021 VSPW Challenge