中文

伪标签在在线源自由通用域适应中的分析

机器学习 2025-06-02 v2 计算机视觉与模式识别

摘要

训练和测试数据之间的域(分布)偏移常常阻碍深度神经网络的实际性能,迫使需要无监督域适应(UDA)来弥合这一差距。 在线源自由UDA已成为解决实际场景问题的方案,其中对源数据的访问受限,目标数据以连续流的形式接收。然而,许多真实世界应用的开放本质进一步引入类别偏移,这意味着源和目标标签空间可能不同。 在线源自由通用域适应(SF-UniDA)解决了这一挑战。现有方法主要依赖伪标签进行自训练,但伪标签与适应结果之间的关系尚未得到研究。为弥合这一差距,我们通过使用模拟伪标签进行受控实验进行系统性分析,为在线SF-UniDA的伪标签提供有价值的见解。我们的发现表明,当前最先进的方法与使用完美伪标签实现的上限之间存在巨大差距。此外,我们表明,对抗损失即使在中等伪标签准确率下也能实现有效的适应,而交叉熵(CE)损失虽然对伪标签错误不够稳健,但在伪标签接近完美时能实现优异结果。最后,我们的发现表明,伪标签准确率通常比数量更为关键,这表明优先考虑更少但高置信度的伪标签有益。总体而言,我们的研究突显了伪标签在(在线)SF-UniDA中的关键作用,并为推动该领域未来发展提供了可操作的见解。我们的代码可在https://github.com/pascalschlachter/PLAnalysis获取。

关键词

引用

@article{arxiv.2504.11992,
  title  = {Analysis of Pseudo-Labeling for Online Source-Free Universal Domain Adaptation},
  author = {Pascal Schlachter and Jonathan Fuss and Bin Yang},
  journal= {arXiv preprint arXiv:2504.11992},
  year   = {2025}
}

备注

Accepted at the 33rd European Signal Processing Conference (EUSIPCO 2025)