中文

从合成数据中学习:ERM的局限性

机器学习 2026-02-04 v2 数据结构与算法 机器学习

摘要

LLM的普及和低成本导致合成内容的增加。从评论网站到法庭文档,“自然”内容已被那些看似与自然数据相似但实际上由LLM生成的数据点所污染。在这项工作中,我们重新审视了这一现已无处不在的场景中的基本学习理论问题。我们将此场景建模为一系列学习任务,其中输入是自然数据和合成数据的混合,且学习算法对任何单个样本的来源是不知的。我们研究了ERM在此场景中的可能性和局限性。对于估计任意 dd 维分布均值的问题,我们发现虽然ERM收敛到真实均值,但其表现不如一种对不同代数据样本赋予非均匀权重的算法。对于PAC学习场景,这种差距更为显著。我们发现ERM并不总是收敛到真实概念,这与模型崩溃文献相呼应。然而,我们证明了存在能够针对任意VC类和任意污染量学习正确假设的算法。

关键词

引用

@article{arxiv.2601.15468,
  title  = {Learning from Synthetic Data: Limitations of ERM},
  author = {Kareem Amin and Alex Bie and Weiwei Kong and Umar Syed and Sergei Vassilvitskii},
  journal= {arXiv preprint arXiv:2601.15468},
  year   = {2026}
}