中文

论 GPT 模型的训练数据影响

计算与语言 2024-10-04 v3 机器学习

摘要

在生成式语言模型快速发展的背景下,关于训练数据如何塑造 GPT 模型性能的研究仍处于起步阶段。本文提出了 GPTfluence,一种利用特征化模拟来评估训练样本对 GPT 模型训练动态影响的新方法。我们的方法不仅追踪了单个训练实例对特定测试点在性能轨迹(如损失和其他关键指标)上的影响,还使得能够在 GPT 模型的各种训练场景下与现有方法进行全面比较,这些场景涵盖从 1400 万到 28 亿参数的模型,并跨越一系列下游任务。与难以泛化到新数据的早期方法不同,GPTfluence 引入了训练动态的参数化模拟,展现了对未见训练数据的稳健泛化能力。这种适应性在微调和指令微调场景中均显而易见,横跨自然语言理解与生成任务。我们在 https://github.com/ernie-research/gptfluence 公开提供了我们的代码和数据。

关键词

引用

@article{arxiv.2404.07840,
  title  = {On Training Data Influence of GPT Models},
  author = {Yekun Chai and Qingyi Liu and Shuohuan Wang and Yu Sun and Qiwei Peng and Hua Wu},
  journal= {arXiv preprint arXiv:2404.07840},
  year   = {2024}
}

备注

EMNLP 2024