中文

MoDA:利用视频运动先验推进语义分割中的无监督域适应

计算机视觉与模式识别 2024-04-16 v2

摘要

无监督域适应(UDA)已成为处理目标域标注缺失尤其是语义分割任务的有力技术。本研究引入一种不同的UDA场景,其中目标域包含无标签视频帧。借鉴近期基于几何约束从无标签视频自监督学习物体运动的进展,我们设计了\textbf{Mo}tion-guided \textbf{D}omain \textbf{A}daptive语义分割框架(MoDA)。MoDA利用自监督物体运动线索促进分割任务的跨域对齐。首先,我们提出物体发现模块,利用物体运动信息定位并分割目标运动物体。随后,我们提出语义挖掘模块,利用物体掩码精炼目标域中的伪标签。接着,这些高质量伪标签被用于自训练循环以弥合跨域差距。在域自适应视频与图像分割实验中,MoDA相比光流信息展示了利用物体运动作为域对齐引导的有效性。此外,MoDA展现出通用性,可补充现有最先进UDA方法。代码见https://github.com/feipanir/MoDA。

关键词

引用

@article{arxiv.2309.11711,
  title  = {MoDA: Leveraging Motion Priors from Videos for Advancing Unsupervised Domain Adaptation in Semantic Segmentation},
  author = {Fei Pan and Xu Yin and Seokju Lee and Axi Niu and Sungeui Yoon and In So Kweon},
  journal= {arXiv preprint arXiv:2309.11711},
  year   = {2024}
}

备注

CVPR 2024 Workshop on Learning with Limited Labelled Data for Image and Video Understanding. Best Paper Award