中文

NLP 训练中的辛普森偏差

计算与语言 2021-03-23 v1 人工智能 机器学习

摘要

在大多数机器学习任务中,我们通过在给定数据总体 SS 上衡量总体级指标 F(S;M)F(S;M) 来评估模型 MM。此类评估指标 FF 的例子包括(二分类)识别的准确率/召回率、多类分类的 F1 分数,以及语言生成的 BLEU 指标。另一方面,模型 MM 在每个学习步 tt 通过优化样本级损失 G(St;M)G(S_t;M) 进行训练,其中 StS_tSS 的子集(即小批量)。GG 的常用选择包括交叉熵损失、Dice 损失和句子级 BLEU 分数。该范式背后的一个基本假设是,样本级损失 GG 的均值若在所有可能样本上取平均,应能有效代表任务的总体级指标 FF,例如 E[G(St;M)]F(S;M)\mathbb{E}[ G(S_t;M) ] \approx F(S;M)。本文中,我们在若干 NLP 任务中系统性地考察上述假设。我们从理论和实验上表明,某些流行的样本级损失 GG 的设计可能与任务的真实总体级指标 FF 不一致,以至于为优化前者而训练的模型相对于后者可能大幅次优,我们将这一现象称为辛普森偏差(Simpson's bias),因其与统计学和社会科学中著名的辛普森反转悖论有着深刻联系。

关键词

引用

@article{arxiv.2103.11795,
  title  = {Simpson's Bias in NLP Training},
  author = {Fei Yuan and Longtu Zhang and Huang Bojun and Yaobo Liang},
  journal= {arXiv preprint arXiv:2103.11795},
  year   = {2021}
}

备注

AAAI 2021