从合成数据中学习:ERM的局限性
机器学习
2026-02-04 v2 数据结构与算法
机器学习
摘要
LLM的普及和低成本导致合成内容的增加。从评论网站到法庭文档,“自然”内容已被那些看似与自然数据相似但实际上由LLM生成的数据点所污染。在这项工作中,我们重新审视了这一现已无处不在的场景中的基本学习理论问题。我们将此场景建模为一系列学习任务,其中输入是自然数据和合成数据的混合,且学习算法对任何单个样本的来源是不知的。我们研究了ERM在此场景中的可能性和局限性。对于估计任意 维分布均值的问题,我们发现虽然ERM收敛到真实均值,但其表现不如一种对不同代数据样本赋予非均匀权重的算法。对于PAC学习场景,这种差距更为显著。我们发现ERM并不总是收敛到真实概念,这与模型崩溃文献相呼应。然而,我们证明了存在能够针对任意VC类和任意污染量学习正确假设的算法。
引用
@article{arxiv.2601.15468,
title = {Learning from Synthetic Data: Limitations of ERM},
author = {Kareem Amin and Alex Bie and Weiwei Kong and Umar Syed and Sergei Vassilvitskii},
journal= {arXiv preprint arXiv:2601.15468},
year = {2026}
}