基于时空像素级对比学习的无源域适应视频语义分割
计算机视觉与模式识别
2023-03-28 v1
摘要
语义分割的无监督域适应(UDA)通过依赖访问源域与目标域数据,将带标签的源域知识迁移到无标签的目标域。然而,在现实场景中,对源数据的访问往往受限或不可行。在源数据受限情形下,UDA 实用性较低。为此,近期研究探索了无源域适应(SFDA)设定下的解决方案,旨在不访问源数据的情况下将源训练模型适配到目标域。但现有 SFDA 方法仅利用图像级信息进行适配,在视频应用中并非最优。本文研究面向视频语义分割(VSS)的 SFDA,利用时间信息解决视频适配问题。具体而言,我们提出时空像素级(STPL)对比学习,一种充分利用时空信息以更好应对源数据缺失的新方法。STPL 显式学习时空空间中像素间的语义关联,为适配无标签目标域提供强自监督。大量实验表明,相较于当前 UDA 与 SFDA 方法,STPL 在 VSS 基准上取得了最先进性能。代码见:https://github.com/shaoyuanlo/STPL
引用
@article{arxiv.2303.14361,
title = {Spatio-Temporal Pixel-Level Contrastive Learning-based Source-Free Domain Adaptation for Video Semantic Segmentation},
author = {Shao-Yuan Lo and Poojan Oza and Sumanth Chennupati and Alejandro Galindo and Vishal M. Patel},
journal= {arXiv preprint arXiv:2303.14361},
year = {2023}
}
备注
Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2023