中文

自训练在域偏移下避免使用伪特征

机器学习 2020-12-09 v3 机器学习

摘要

在无监督域适应中,现有理论聚焦于源域与目标域接近的情形。在实践中,条件熵最小化与伪标注即便在域偏移远大于现有理论所分析的范围时仍有效。我们识别并分析了一种域偏移可能很大但这些算法可证明有效的特定设定:某些伪特征在源域中与标签相关,而在目标域中与标签独立。我们的分析考虑线性分类,其中伪特征为高斯分布,非伪特征为对数凹分布的混合。对于该设定,我们证明了对未标注目标数据进行熵最小化,若以相当准确的源分类器初始化,将避免使用伪特征,尽管目标函数非凸且存在多个利用伪特征的不良局部极小。我们在半合成 Celeb-A 与 MNIST 数据集上验证了关于伪域偏移任务的理论。我们的结果表明,实践者应收集并在大型多样数据集上进行自训练,以减少分类器中的偏差,即便标注不可行。

关键词

引用

@article{arxiv.2006.10032,
  title  = {Self-training Avoids Using Spurious Features Under Domain Shift},
  author = {Yining Chen and Colin Wei and Ananya Kumar and Tengyu Ma},
  journal= {arXiv preprint arXiv:2006.10032},
  year   = {2020}
}