中文

面向大型语言模型的逐词级有影响力训练数据检索

计算与语言 2024-10-24 v2 人工智能 密码学与安全 信息检索

摘要

给定一个大型语言模型(LLM)生成,我们如何识别哪些训练数据导致了该生成?本文提出RapidIn,一个可扩展的框架,适用于LLM以估计每个训练数据的影响力。该框架包括两个阶段:缓存和检索。首先,我们将梯度向量压缩超过200,000倍,使其能够缓存在磁盘或GPU/CPU内存中。然后,给定一个生成,RapidIn高效遍历缓存的梯度以在几分钟内估计影响力,实现超过6,326倍的加速。此外,RapidIn支持多GPU并行化,以显著加速缓存和检索。我们的实证结果证实了RapidIn的效率和有效性。

关键词

引用

@article{arxiv.2405.11724,
  title  = {Token-wise Influential Training Data Retrieval for Large Language Models},
  author = {Huawei Lin and Jikai Long and Zhaozhuo Xu and Weijie Zhao},
  journal= {arXiv preprint arXiv:2405.11724},
  year   = {2024}
}

备注

Accepted to ACL 2024. Keywords: Influence Function, Influence Estimation, Training Data Attribution