中文

当坏数据导致好模型

机器学习 2025-05-09 v1 人工智能 计算与语言

摘要

在大型语言模型(LLM)预训练中,数据质量被认为决定模型质量。本文从预训练与后训练协同设计的角度重新审视“质量”的概念。具体而言,我们探讨了在后训练中利用更有毒性的数据是否能实现更好的控制,从而降低模型输出的毒性。首先,我们使用 toy 实验研究数据组成如何影响表示空间中特征的几何结构。随后,通过在不同清洁数据与毒性数据比例下训练 Olmo-1B 模型的受控实验,发现随着毒性数据比例增加,毒性概念的线性表示变得更不交织。进一步表明,尽管毒性数据会增加基础模型的生成式毒性,但也使其去毒化更加容易。针对 Toxigen 和 Real Toxicity Prompts 上的评估显示,使用推理时干预(ITI)等去毒化技术时,训练于毒性数据上的模型在降低生成式毒性与保持通用能力之间实现了更好的权衡。我们的发现表明,在考虑后训练的情况下,坏数据可能导致好模型。

关键词

引用

@article{arxiv.2505.04741,
  title  = {When Bad Data Leads to Good Models},
  author = {Kenneth Li and Yida Chen and Fernanda Viégas and Martin Wattenberg},
  journal= {arXiv preprint arXiv:2505.04741},
  year   = {2025}
}

备注

ICML 2025