从有限和不完美数据中学习
机器学习
2025-07-30 v1 人工智能
计算机视觉与模式识别
摘要
世界上数据分布(例如互联网等)显著不同于精心挑选的数据集,往往包含来自常见类别的样本过多。为精心挑选的数据集设计的算法在用于学习来自不完美数据集(具有长尾不平衡和分布迁移)的学习时表现不佳。为了扩展深度模型的应用,必须通过发展能从多样化、真实世界数据分布中学习的鲁棒算法来克服繁琐的数据标注过程。为此目标,我们开发了用于深度神经网络的实用算法,这些算法能够从真实世界中有限且不完美的数据中进行学习。本论文分为四个部分,每个部分涵盖从有限或不完美数据中学习的某种情形。论文的前两部分专注于从长尾数据中学习生成模型,通过抑制模式崩溃并为尾部(少数)类别实现多样化的审美图像生成。在第二部分,我们通过归纳正则化方案,使尾部类别能够有效地泛化,无需显式生成图像。在第三部分,我们开发了针对从长尾数据中学习的优化相关指标的算法(半监督学习),随后在第四部分,我们关注如何对模型进行高效的领域适应,以适应各种数据域,其中标注样本极少或为零。
引用
@article{arxiv.2507.21205,
title = {Learning from Limited and Imperfect Data},
author = {Harsh Rangwani},
journal= {arXiv preprint arXiv:2507.21205},
year = {2025}
}
备注
PhD Thesis