论 GPT 模型的训练数据影响
计算与语言
2024-10-04 v3 机器学习
摘要
在生成式语言模型快速发展的背景下,关于训练数据如何塑造 GPT 模型性能的研究仍处于起步阶段。本文提出了 GPTfluence,一种利用特征化模拟来评估训练样本对 GPT 模型训练动态影响的新方法。我们的方法不仅追踪了单个训练实例对特定测试点在性能轨迹(如损失和其他关键指标)上的影响,还使得能够在 GPT 模型的各种训练场景下与现有方法进行全面比较,这些场景涵盖从 1400 万到 28 亿参数的模型,并跨越一系列下游任务。与难以泛化到新数据的早期方法不同,GPTfluence 引入了训练动态的参数化模拟,展现了对未见训练数据的稳健泛化能力。这种适应性在微调和指令微调场景中均显而易见,横跨自然语言理解与生成任务。我们在 https://github.com/ernie-research/gptfluence 公开提供了我们的代码和数据。
引用
@article{arxiv.2404.07840,
title = {On Training Data Influence of GPT Models},
author = {Yekun Chai and Qingyi Liu and Shuohuan Wang and Yu Sun and Qiwei Peng and Hua Wu},
journal= {arXiv preprint arXiv:2404.07840},
year = {2024}
}
备注
EMNLP 2024