矩方法潜变量估计中标注与未标注数据的价值比较
机器学习
2021-03-05 v1 机器学习
摘要
为现代机器学习标注数据昂贵且耗时。潜变量模型可用于从作用于未标注数据的更弱、更易获取的源中推断标签。此类模型也可用标注数据训练,这带来一个关键问题:用户应投资于少量标注点还是大量未标注点?我们通过一个以矩方法潜变量估计中模型误设为重心的框架来回答此问题。我们的核心结果是对泛化误差的偏差-方差分解,表明在误设下仅用未标注数据的方法会产生额外偏差。随后我们引入一种在特定情形下可证明消除该偏差的修正方法。我们将分解框架应用于三种场景——正确设定、误设与修正模型——以 1)在标注与未标注数据间做选择,2)从二者结合中学习。我们通过理论与合成实验观察到:对正确设定模型,标注点的价值是未标注点的常数倍;然而在误设下,由于额外偏差,其相对价值更高,但可通过修正降低。我们还将该方法应用于研究真实世界用于数据集构建的弱监督技术。
引用
@article{arxiv.2103.02761,
title = {Comparing the Value of Labeled and Unlabeled Data in Method-of-Moments Latent Variable Estimation},
author = {Mayee F. Chen and Benjamin Cohen-Wang and Stephen Mussmann and Frederic Sala and Christopher Ré},
journal= {arXiv preprint arXiv:2103.02761},
year = {2021}
}
备注
To appear in AISTATS 2021