中文

基于锚定置信度提升分布迁移下的自训练(带理论保证)

机器学习 2024-11-04 v1

摘要

在分布迁移情况下,自训练往往难以实现,因为预测置信度与实际准确性之间的差距会增加。这通常需要计算密集型方法,如基于邻域或集成的标签修正。drawing inspiration from early learning regularization的洞见,我们发展了一种基于时间一致性的原则方法,以提高分布迁移下的自训练效果。具体而言,我们构建了一个结合简单相对阈值的不确定性感知的时间序列集成。该集成平滑了噪声伪标签,以促进选择性时间一致性。我们证明了时间序列集成是渐近正确的,且我们的标签平滑技术可缩小自训练的最优间隙。我们的大量实验表明,在多样化的分布迁移情景下,我们的方法可通过8%至16%的性能提升显著改善自训练效果,而且没有计算开销。此外,我们的方法具有诸多吸引性特性,如 improved calibration性能以及对不同超参数选择的鲁棒性。

关键词

引用

@article{arxiv.2411.00586,
  title  = {Improving self-training under distribution shifts via anchored confidence with theoretical guarantees},
  author = {Taejong Joo and Diego Klabjan},
  journal= {arXiv preprint arXiv:2411.00586},
  year   = {2024}
}

备注

NeurIPS 2024