NLP 训练中的辛普森偏差
计算与语言
2021-03-23 v1 人工智能
机器学习
摘要
在大多数机器学习任务中,我们通过在给定数据总体 上衡量总体级指标 来评估模型 。此类评估指标 的例子包括(二分类)识别的准确率/召回率、多类分类的 F1 分数,以及语言生成的 BLEU 指标。另一方面,模型 在每个学习步 通过优化样本级损失 进行训练,其中 是 的子集(即小批量)。 的常用选择包括交叉熵损失、Dice 损失和句子级 BLEU 分数。该范式背后的一个基本假设是,样本级损失 的均值若在所有可能样本上取平均,应能有效代表任务的总体级指标 ,例如 。本文中,我们在若干 NLP 任务中系统性地考察上述假设。我们从理论和实验上表明,某些流行的样本级损失 的设计可能与任务的真实总体级指标 不一致,以至于为优化前者而训练的模型相对于后者可能大幅次优,我们将这一现象称为辛普森偏差(Simpson's bias),因其与统计学和社会科学中著名的辛普森反转悖论有着深刻联系。
引用
@article{arxiv.2103.11795,
title = {Simpson's Bias in NLP Training},
author = {Fei Yuan and Longtu Zhang and Huang Bojun and Yaobo Liang},
journal= {arXiv preprint arXiv:2103.11795},
year = {2021}
}
备注
AAAI 2021