数量 vs 质量:探究样本规模与标签可靠性之间的权衡
机器学习
2022-04-21 v1 人工智能
机器学习
摘要
本文研究概率域中的学习问题,其中学习者可能接收到错误标签,但可通过重复采样来提高标签的可靠性。在此设定下,人们面临如下问题:用于获取训练样本的固定预算应被用于获取所有不同的样本,还是用于通过对较小数量样本的标签重新采样来提升其标签质量。我们在一个比较扑克牌手牌强度的应用中引出该问题,其训练信号依赖于隐藏的公共牌,随后在一个人工设定中深入研究该问题,其中我们向 MNIST 数据库注入受控的噪声水平。我们的结果表明,随着噪声水平的增加,对先前样本重新采样变得比获取新样本越来越重要,因为当错误标签数量过高时分类器性能会恶化。此外,我们提出两种不同的验证策略:在训练过程中从较低验证切换到较高验证,以及使用卡方统计量来近似所获标签的置信度。
引用
@article{arxiv.2204.09462,
title = {Quantity vs Quality: Investigating the Trade-Off between Sample Size and Label Reliability},
author = {Timo Bertram and Johannes Fürnkranz and Martin Müller},
journal= {arXiv preprint arXiv:2204.09462},
year = {2022}
}
备注
Preliminary work under review for ICML 2022