噪声对比学习中的最优噪声并非如你所想
机器学习
2022-07-27 v2 机器学习
摘要
学习数据分布的参数模型是一个众所周知的统计问题,随着它在深度学习中被大规模应用,这一问题重新引起了人们的兴趣。将该问题构建为一个自监督任务,即从噪声样本中区分数据样本,是当前最先进方法的核心,这始于噪声对比估计(Noise-Contrastive Estimation, NCE)。然而,这种对比学习需要一个好的噪声分布,而这很难指定;因此,领域特定的启发式方法被广泛使用。虽然缺乏一个全面的理论,但人们普遍认为,在实践中,最优噪声应在分布和比例上都与数据相等。这种设定尤其构成了生成对抗网络(Generative Adversarial Networks, GANs)的基础。在此,我们通过实验和理论挑战了这一关于最优噪声的假设。我们表明,偏离这一假设实际上可以带来更好的统计估计量,体现在渐近方差方面。特别是,最优噪声分布不同于数据分布,甚至来自不同的分布族。
引用
@article{arxiv.2203.01110,
title = {The Optimal Noise in Noise-Contrastive Learning Is Not What You Think},
author = {Omar Chehab and Alexandre Gramfort and Aapo Hyvarinen},
journal= {arXiv preprint arXiv:2203.01110},
year = {2022}
}