中文

分布鲁棒数据联结

机器学习 2023-06-16 v2

摘要

假设我们有两个数据集:一个带标签数据集和一个无标签数据集,后者还包含第一个数据集中没有的额外辅助特征。最合乎原则地联合使用这些数据集来构建预测器的方法是什么?答案应取决于这些数据集是否在其共同特征集上由相同或不同的分布生成,以及测试分布与这两个分布中的哪一个相似。在许多应用中,两个数据集可能遵循不同的分布,但都可能接近测试分布。我们引入这样一个问题:构建一个预测器,使其在所有关于原始特征、辅助特征和二值标签的概率分布上的最大损失最小化,这些分布的 Wasserstein 距离距带标签数据集上的经验分布为 r1r_1、距无标签数据集上的经验分布为 r2r_2。这可被视为分布鲁棒优化(DRO)的一种推广,其允许两个数据源,其中一个无标签且可能包含辅助特征。

关键词

引用

@article{arxiv.2202.05797,
  title  = {Distributionally Robust Data Join},
  author = {Pranjal Awasthi and Christopher Jung and Jamie Morgenstern},
  journal= {arXiv preprint arXiv:2202.05797},
  year   = {2023}
}