中文

基于跨域运动目标混合的域自适应视频语义分割

计算机视觉与模式识别 2023-01-30 v2

摘要

为域自适应训练的网络容易偏向易于迁移的类别。由于在训练期间目标域的真实标签不可用,该偏差问题导致预测偏斜,遗忘预测难以迁移的类别。为解决此问题,我们提出跨域运动目标混合(CMOM),其从源域视频片段中裁剪若干包含难以迁移类别的目标,并粘贴至目标域视频片段中。与图像级域自适应不同,时间上下文应保持以混合两个不同视频中的运动目标。因此,我们设计CMOM以连续视频帧进行混合,从而避免不真实的移动。我们额外提出具有时间上下文的特征对齐(FATC)以增强目标域特征可判别性。FATC利用以真实标签训练的鲁棒源域特征,通过时间一致性过滤不可靠预测,以无监督方式学习判别性目标域特征。我们通过大量实验证明了所提方法的有效性。特别地,我们的模型在VIPER到Cityscapes-Seq基准上达到53.81%的mIoU,在SYNTHIA-Seq到Cityscapes-Seq基准上达到56.31%的mIoU,大幅超越SOTA方法。代码见:https://github.com/kyusik-cho/CMOM。

关键词

引用

@article{arxiv.2211.02307,
  title  = {Domain Adaptive Video Semantic Segmentation via Cross-Domain Moving Object Mixing},
  author = {Kyusik Cho and Suhyeon Lee and Hongje Seong and Euntai Kim},
  journal= {arXiv preprint arXiv:2211.02307},
  year   = {2023}
}

备注

WACV 2023