中文

首层优于末层:语言数据影响力分析

机器学习 2022-10-28 v3 计算与语言 计算机与社会

摘要

识别有影响力的训练样本的能力使我们能够调试训练数据并解释模型行为。现有的技术基于训练数据影响力通过模型参数的流动来实现。对于 NLP 应用中的大型模型,研究这种通过所有模型参数的流动通常在计算上不可行,因此技术通常选取最后一层权重。然而,我们观察到,由于与最后一层权重相连的激活包含“共享逻辑”,通过最后一层权重计算的数据影响力容易出现“抵消效应”,即不同样本的数据影响力具有相互抵消的大幅度。抵消效应降低了影响力分数的判别力,并且依据该度量删除有影响力的样本通常并不会显著改变模型行为。为缓解此问题,我们提出一种称为 TracIn-WE 的技术,该技术修改了名为 TracIn 的方法,使其在词嵌入层而非最后一层上操作,此处抵消效应较轻。一个潜在的担忧是基于词嵌入层的影响力可能未编码足够的高级信息。然而,我们发现梯度(不同于嵌入)不会受此影响,可能是因为它们通过更高层链式传播。我们表明,在三种语言分类任务上针对不同模型进行的样本删除评估中,TracIn-WE 显著优于应用于最后一层的其他数据影响力方法。此外,TracIn-WE 不仅能给出整体训练输入层级上的分数,还能给出训练输入中词层级上的分数,进一步辅助调试。

关键词

引用

@article{arxiv.2202.11844,
  title  = {First is Better Than Last for Language Data Influence},
  author = {Chih-Kuan Yeh and Ankur Taly and Mukund Sundararajan and Frederick Liu and Pradeep Ravikumar},
  journal= {arXiv preprint arXiv:2202.11844},
  year   = {2022}
}