中文

使用合成数据训练模型会使模型更不健壮吗?

计算与语言 2025-03-18 v2 人工智能 机器学习

摘要

越来越常见的做法是使用合成数据训练大型语言模型(LLM)。这些合成数据往往由用于训练的相同或类似LLM生成。这引出了一个问题:合成数据是否可能通过强化LLM已编码的某些“盲点”从而加剧这些盲点?本文针对自然语言推理(NLI)任务,对Llama-2-7B-hf模型进行仿真实验。我们采用MultiNLI作为通用任务,采用HANS——一个旨在衡量NLI特定启发策略是否存在的针对性评估集作为我们的“盲点”任务。我们的目标是确定通用任务与盲点任务之间是否存在性能差异。我们的结果表明,合成数据并未以我们原预期的方式强化盲点。具体而言,我们发现尽管使用合成数据微调并不一定会减少对该启发策略的使用,但也不会像我们原假设的那样使其变得更差。

关键词

引用

@article{arxiv.2502.07164,
  title  = {Does Training on Synthetic Data Make Models Less Robust?},
  author = {Lingze Zhang and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2502.07164},
  year   = {2025}
}