中文

语言数据集漂移的刻画与度量

计算与语言 2023-05-29 v1

摘要

当真实世界数据分布与训练数据显著不同时,NLP 模型性能常会下降。然而,NLP 中现有的数据集漂移度量通常未考虑影响模型性能的语言漂移具体维度,且未在个体样本层面预测模型性能的能力上得到验证,而此类度量在实践中常于该层面使用。本文提出语言数据集漂移的三个维度:词汇、结构与语义漂移。这些维度分别对应内容词频率差异、句法差异以及未被词频捕捉的意义变化(如词汇语义变化)。我们为所有三个漂移维度提出可解释的度量,并改进以往的性能预测方法,以在英文情感分类与自然语言推理上预测样本层面与数据集层面的模型性能。我们发现,我们的漂移度量比以往度量更能有效预测域外模型准确率(均方根误差平均降低 16.8%),尤其与流行的微调嵌入距离相比(误差平均降低 47.7%)。微调嵌入距离在按预期性能对个体样本排序上更有效,但分解为词汇、结构与语义漂移产生了所有考虑的与模型无关的漂移度量中最佳的样本排序(ROC AUC 平均提升 6.7%)。

关键词

引用

@article{arxiv.2305.17127,
  title  = {Characterizing and Measuring Linguistic Dataset Drift},
  author = {Tyler A. Chang and Kishaloy Halder and Neha Anna John and Yogarshi Vyas and Yassine Benajiba and Miguel Ballesteros and Dan Roth},
  journal= {arXiv preprint arXiv:2305.17127},
  year   = {2023}
}

备注

Accepted to ACL 2023