中文

具有非随机缺失数据的无监督域适应

机器学习 2021-09-21 v1

摘要

我们考虑在无标签目标域存在缺失数据情况下的无监督域适应(UDA)分类问题。更确切地说,受实际应用驱动,我们分析域间存在分布偏移、且某些分量在目标域上系统性缺失且无可用监督来填补缺失目标分量的情形。我们提出一种生成式填补方法。填补在域不变潜在空间中执行,并利用来自完整源域的间接监督。我们引入一个执行联合适应、填补与分类的单一模型,该模型在我们的假设下最小化其目标泛化误差的上界,并在多种代表性散度族(H-散度、最优传输)下表现良好。此外,我们将我们的适应-填补框架的目标误差与无缺失目标分量的“理想”UDA分类器的目标误差进行比较。我们的模型进一步通过自训练改进,以拉近所学源域与目标域类后验分布。我们在三类不同模态的数据集上开展实验:常用的数字分类基准、UDA中常用的Amazon产品评论数据集,以及真实世界数字广告数据集。我们展示了在这些数据集上联合执行适应、分类与填补的益处。

关键词

引用

@article{arxiv.2109.09505,
  title  = {Unsupervised domain adaptation with non-stochastic missing data},
  author = {Matthieu Kirchmeyer and Patrick Gallinari and Alain Rakotomamonjy and Amin Mantrach},
  journal= {arXiv preprint arXiv:2109.09505},
  year   = {2021}
}