通过考虑拟合误差增强大语言模型的训练数据归因
计算与语言
2024-11-20 v2
摘要
大语言模型(LLMs)的黑箱特性在解释结果方面存在挑战,影响数据知识产权保护和幻觉追踪等问题。训练数据归因(TDA)方法被视为解决这些挑战的有效手段。但大多数最新TDA方法依赖影响函数,假设模型已实现最小经验风险。然而,实现这一标准困难,训练过程中的拟合误差可能损害准确性。本文引入一种新颖的TDA方法,称为Debias and Denoise Attribution(去偏去噪归因),通过解决拟合误差来增强影响函数。具体而言,去偏策略通过消除基础模型在微调前所携带的知识偏差来提升影响函数性能;去噪策略则通过平滑技术减少训练过程中拟合程度差异导致的影响得分偏差。实验结果表明,我们的方法显著优于现有方法,平均AUC达91.64%。此外,DDA在各种数据来源和不同规模模型(如LLaMA2、QWEN2、Mistral)上表现出强大的通用性和可扩展性。
引用
@article{arxiv.2410.01285,
title = {Enhancing Training Data Attribution for Large Language Models with Fitting Error Consideration},
author = {Kangxi Wu and Liang Pang and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2410.01285},
year = {2024}
}
备注
Accepted to the EMNLP 2024 main