中文

从噪声数据中优先选择信息丰富特征与样本以提升深度学习效果

机器学习 2024-08-13 v2

摘要

本论文提出一个系统化框架,通过优先选择信息丰富的特征与样本来提升开发过程中各环节的性能。具体而言,我们在特征学习、数据标注和数据选择三个环节中优先选择信息丰富的特征与样本。首先,我们提出一种方法,通过利用辅助的 out-of-distribution 数据来提取仅与目标任务相关的特征信息。利用该 out-of-distribution 数据中的特征来抑制目标分布中的噪声特征。接着,我们引入一种方法,从未标注的噪声数据中优先选择信息丰富的样本,以减少主动学习的标注成本。为解决信息纯度困境——即选择信息丰富样本会导致许多噪声样本被选中——我们提出一个元模型,用于在纯度与信息丰富性之间找到最佳平衡。最后,我们提出一种方法,从已标注的噪声数据中优先选择信息丰富的样本,以保持数据选择的性能。对于已标注的图像噪声数据,我们提出一种数据选择方法,考虑到相邻样本的置信度,以保持最新 Re-labeling 模型的性能。对于已标注的文本噪声数据,我们提出一种指令选择方法,考虑多样性,对指令质量进行排序以提升对齐型大语言模型的性能。总体而言,我们的统一框架使深度学习开发过程对噪声数据更具鲁棒性,从而有效缓解了现实应用中的噪声特征与样本。

关键词

引用

@article{arxiv.2403.00013,
  title  = {Prioritizing Informative Features and Examples for Deep Learning from Noisy Data},
  author = {Dongmin Park},
  journal= {arXiv preprint arXiv:2403.00013},
  year   = {2024}
}

备注

PhD thesis