用于视频语义分割的无监督领域自适应
计算机视觉与模式识别
2021-09-14 v2
摘要
用于语义分割的无监督领域自适应因能够将知识从仿真迁移到现实并大幅减少现实中费力的逐像素标注工作而获得了极大的关注。在本工作中,我们提出了该任务的一个新视频扩展,即用于视频语义分割的无监督领域自适应。由于通过仿真获取大规模视频标签变得容易,我们相信尝试最大化 Sim2Real 知识可迁移性是解决视频中根本的数据饥渴问题的有前景的方向之一。为解决这一新问题,我们提出了一种新颖的两阶段自适应方案。在第一步中,我们使用有监督损失函数详尽地提取源领域知识。同时,采用视频对抗训练(VAT)利用视频上下文将特征从源对齐到目标。在第二步中,我们应用视频自训练(VST),仅关注目标数据。为了构建鲁棒的伪标签,我们利用了视频中的时间信息,这在以往基于图像的自训练方法中很少被探索。我们在“VIPER 到 CityscapeVPS”自适应场景上设定了强基线分数。我们表明,我们的提案在图像级和视频级评估指标上均显著优于以往基于图像的无监督领域自适应方法。
引用
@article{arxiv.2107.11052,
title = {Unsupervised Domain Adaptation for Video Semantic Segmentation},
author = {Inkyu Shin and Kwanyong Park and Sanghyun Woo and In So Kweon},
journal= {arXiv preprint arXiv:2107.11052},
year = {2021}
}