中文

利用算法思维链理解 LLM 训练数据中噪声的影响

机器学习 2024-02-12 v2

摘要

在预训练和微调期间,大型语言模型 (\textbf{LLMs}) 都在数万亿个质量参差不齐的文本 token 上进行训练。这两个训练阶段通常涉及启发式地过滤掉“低质量”或\emph{噪声}训练样本,但对于噪声的类型或强度如何定量影响下游性能,人们知之甚少。在这项工作中,我们在算法可解任务的高度受控环境中,研究了思维链 (\textbf{CoT}) 中的噪声如何影响任务性能。首先,我们开发了追踪整数 (\textbf{TInt}) 框架,为任何整数列表上的算术函数生成高度可定制的噪声执行轨迹。然后,我们定义了两种类型的噪声:\emph{静态}噪声,这是一种在 CoT 轨迹计算后应用的局部噪声形式;以及\emph{动态}噪声,这是一种在轨迹计算过程中传播错误的全局噪声形式。随后,我们评估了在不同程度的数据集污染和强度下,在噪声数据集上进行提示和微调的预训练模型的测试性能。我们发现,微调模型对高水平的静态噪声具有极强的鲁棒性,但在较低水平的动态噪声下表现明显更差。相比之下,少样本提示模型似乎甚至对静态噪声更为敏感。最后,我们讨论了我们的发现如何影响噪声过滤的最佳实践,特别强调了去除包含具有全局错误的破坏性动态噪声样本的重要性。

关键词

引用

@article{arxiv.2402.04004,
  title  = {Understanding the Effect of Noise in LLM Training Data with Algorithmic Chains of Thought},
  author = {Alex Havrilla and Maia Iyer},
  journal= {arXiv preprint arXiv:2402.04004},
  year   = {2024}
}