将无标签数据引入分布鲁棒学习
机器学习
2019-12-19 v2 机器学习
摘要
我们研究经验风险最小化的一种鲁棒替代方法,称为分布鲁棒学习(DRL),其中学习者在面对可从一组指定分布中选择数据分布的对手时仍能良好表现。我们阐明了当前 DRL 公式的一个问题:其对手所允许分布的定义过于宽泛,导致所学分类器无法作出任何有置信度的预测。我们提出一种解决方案,将无标签数据引入 DRL 问题以进一步约束对手。我们证明这一新公式对于基于随机梯度的优化是可处理的,并给出所学分类器未来性能的可计算保证,类似于常规 DRL 的保证但更紧。我们在 14 个真实数据集上检验该新公式的性能,发现其在常规 DRL 既无法产生有效分类器也无保证的情况下,常能产出具有非平凡性能保证的有效分类器。受这些结果启发,我们将 DRL 公式扩展至主动学习,提出一种新颖的、分布鲁棒版本的标准模型变化启发式方法。我们的主动学习算法在真实数据集上常取得优于原始启发式的学习性能。
引用
@article{arxiv.1912.07729,
title = {Incorporating Unlabeled Data into Distributionally Robust Learning},
author = {Charlie Frogner and Sebastian Claici and Edward Chien and Justin Solomon},
journal= {arXiv preprint arXiv:1912.07729},
year = {2019}
}