遗忘学习追踪语言模型的有影响力训练数据
计算与语言
2024-06-14 v2 人工智能
摘要
识别影响语言模型输出的训练数据集对于最小化有害内容的生成和提升其性能至关重要。理想情况下,我们可以通过从训练中移除每个数据集来衡量其影响力;然而,多次重新训练模型代价高昂。本文提出了UnTrac:通过遗忘学习追踪训练数据集对模型性能的影响。UnTrac非常简单;每个训练数据集通过梯度上升进行遗忘,我们评估遗忘后模型预测的变化程度。此外,我们提出了一种更具可扩展性的方法UnTrac-Inv,它遗忘一个测试数据集,并在训练数据集上评估遗忘后的模型。UnTrac-Inv类似于UnTrac,同时对于大规模训练数据集更为高效。在实验中,我们检验了我们的方法能否评估预训练数据集对生成有毒、有偏见和不真实内容的影响力。我们的方法在不需要过多内存空间或多个检查点的情况下,比现有方法更准确地估计了它们的影响力。
引用
@article{arxiv.2401.15241,
title = {Unlearning Traces the Influential Training Data of Language Models},
author = {Masaru Isonuma and Ivan Titov},
journal= {arXiv preprint arXiv:2401.15241},
year = {2024}
}
备注
14 pages, to appear in ACL2024 main conference (long paper)