中文

利用无标签数据校准适应偏移相关性

机器学习 2024-09-11 v1

摘要

站点之间的分布偏移会严重降低模型性能,因为模型倾向于利用不稳定的相关性。因此,许多方法试图找到跨站点稳定的特征并丢弃不稳定的特征。然而,不稳定的特征可能包含互补信息,如果使用得当,可以提高准确性。更新的方法试图适应新站点的不稳定特征以获得更高的准确性。然而,它们做出了不切实际的假设,或者无法扩展到多个混杂特征。我们提出了广义流行率调整(Generalized Prevalence Adjustment,简称 GPA),这是一种灵活的方法,可以调整模型预测以适应预测目标与混杂因素之间偏移的相关性,从而安全地利用不稳定特征。GPA 可以利用来自新站点的无标签样本推断目标与混杂因素在新站点中的相互作用。我们在多个真实和合成数据集上评估了 GPA,并表明它优于竞争性基线方法。

关键词

引用

@article{arxiv.2409.05996,
  title  = {Adapting to Shifting Correlations with Unlabeled Data Calibration},
  author = {Minh Nguyen and Alan Q. Wang and Heejong Kim and Mert R. Sabuncu},
  journal= {arXiv preprint arXiv:2409.05996},
  year   = {2024}
}

备注

Accepted at ECCV