在可靠性未知的数据源上训练神经网络
机器学习
2025-02-17 v4 机器学习
摘要
当数据由多个源生成时,常规训练方法在更新模型时假设每个源具有相等的可靠性,而不考虑它们各自的数据质量。然而,在许多应用中,数据源具有不同水平的可靠性,这会对神经网络的性能产生负面影响。一个关键问题是,在训练期间各个源的数据质量通常未知。先前在含噪数据下训练模型的方法未利用源标签所能提供的额外信息。聚焦于监督学习,我们旨在通过使用受似然退火启发的动态重加权策略,按各数据源估计可靠性成比例的步骤数在每个数据源上训练神经网络。这样,我们允许在预热阶段在所有源上训练,并在最终训练阶段(已证明模型会对噪声过拟合)减少对可靠性较低源的学习。我们通过多样化实验表明,当在可靠与不可靠数据源的混合上训练时,这能显著提升模型性能,并且在仅于可靠源上训练时保持性能。
引用
@article{arxiv.2212.02895,
title = {Training Neural Networks on Data Sources with Unknown Reliability},
author = {Alexander Capstick and Francesca Palermo and Tianyu Cui and Payam Barnaghi},
journal= {arXiv preprint arXiv:2212.02895},
year = {2025}
}