Co-STAR:基于自适应正则化的协作课程自训练,用于源自由视频域适应
计算机视觉与模式识别
2025-09-23 v2
摘要
近期在源自由无监督视频域适应(SFUVDA)中,利用视觉语言模型增强伪标签生成。然而,噪声伪标签和过于自信的预测限制了其在跨域适应中的效果。我们提出 Co-STAR,一种新型框架,将课程学习与基于对比学习的视觉语言模型(CLIP)之间的协作自训练集成。我们的课程学习方法采用可靠性加权函数,衡量教师与 CLIP 之间的双向预测对齐程度,在自信与不确定的预测之间进行权衡。该函数保留困难样本的不确定性,同时在两者预测高度一致时优先选择可靠伪标签。为进一步提升适应效果,我们提出自适应课程正则化,该方法根据样本的置信度和预测稳定性以概率方式、自适应地修改样本的学习优先级,从而缓解对噪声和过于自信样本的过拟合。广泛的实验在多个视频域适应基准数据集上表明,Co-STAR 在 SOTA SFUVDA 方法中 consistently 取得优异性能。代码已公开:https://github.com/Plrbear/Co-Star
引用
@article{arxiv.2504.11669,
title = {Co-STAR: Collaborative Curriculum Self-Training with Adaptive Regularization for Source-Free Video Domain Adaptation},
author = {Amirhossein Dadashzadeh and Parsa Esmati and Majid Mirmehdi},
journal= {arXiv preprint arXiv:2504.11669},
year = {2025}
}