数据集平衡可能损害模型性能
机器学习
2023-07-04 v1 声音
音频与语音处理
摘要
从每类样本分布倾斜的训练数据进行机器学习,可能导致模型以牺牲稀有类性能为代价偏向常见类性能。AudioSet 在其 527 个声音事件类上具有非常宽泛的先验分布。AudioSet 上的分类性能通常通过逐类指标简单平均来评估,这意味着稀有类性能与常见类性能同等重要。近期的若干论文已使用数据集平衡技术来提升 AudioSet 上的性能。然而,我们发现,尽管平衡提升了在公开 AudioSet 评估数据上的性能,它同时损害了在相同条件下收集的未公开评估集上的性能。通过改变平衡程度,我们表明其收益是脆弱的且依赖于评估集。我们亦未发现证据表明平衡相对于常见类改善了稀有类性能。因此,我们警示勿盲目应用平衡,亦勿过度关注公开评估集上的微小提升。
引用
@article{arxiv.2307.00079,
title = {Dataset balancing can hurt model performance},
author = {R. Channing Moore and Daniel P. W. Ellis and Eduardo Fonseca and Shawn Hershey and Aren Jansen and Manoj Plakal},
journal= {arXiv preprint arXiv:2307.00079},
year = {2023}
}
备注
5 pages, 3 figures, ICASSP 2023