GPT 什么时候值得您的数据?LLM 规模数据估值与影响函数
机器学习
2024-05-24 v1 人工智能
计算与语言
摘要
大语言模型(LLM)是在大量人类编写的数据上进行训练的,但数据提供者往往无法获得信用。为了解决这一问题,数据估值(或数据归因)——即量化每个数据对模型输出的贡献或价值——被讨论作为一种潜在解决方案。然而,将现有的估值方法应用于最新的 LLM 及其庞大的训练数据集的效果仍大多受限于禁用计算和内存成本。本文我们关注影响函数,这是一种流行的梯度基础数据估值方法,并通过一种高效的梯度投影策略 LoGra 来显著提高其可扩展性,该策略利用反向传播中的梯度结构。我们随后提供梯度投影方法对影响函数的理论动机,以促进对数据估值过程的信任。最后,我们通过引入 LogIX,一个可以将现有训练代码转换为数据估值代码的软件包,来降低数据估值系统的实施障碍。在我们的数据估值实验中,LoGra 在保持竞争精度的同时,对 Llama3-8B-Instruct 和 1B token 数据集实现了最高 6,500 倍的吞吐量提升和 5 倍的 GPU 内存使用降低。
引用
@article{arxiv.2405.13954,
title = {What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions},
author = {Sang Keun Choe and Hwijeen Ahn and Juhan Bae and Kewen Zhao and Minsoo Kang and Youngseog Chung and Adithya Pratapa and Willie Neiswanger and Emma Strubell and Teruko Mitamura and Jeff Schneider and Eduard Hovy and Roger Grosse and Eric Xing},
journal= {arXiv preprint arXiv:2405.13954},
year = {2024}
}