面向数据不平衡 NLP 任务的 Dice 损失
计算与语言
2020-09-01 v3
摘要
许多 NLP 任务(如标注和机器阅读理解)面临严重的数据不平衡问题:负例显著多于正例,且海量背景例(或易负例)在训练中占据主导。最常用的交叉熵(CE)准则实际上是一种以准确率为导向的目标,因而造成训练与测试之间的不一致:训练时每个训练样本对目标函数的贡献相等,而测试时 F1 分数更关注正例。本文提出以 dice 损失替代标准交叉熵目标,用于数据不平衡的 NLP 任务。dice 损失基于 Sorensen-Dice 系数或 Tversky 指数,其对假阳性与假阴性赋予相近重要性,且对数据不平衡问题更具鲁棒性。为进一步缓解训练中易负例的主导影响,我们提出为训练样本关联动态调整的权重,以弱化易负例的重要性。理论分析表明,该策略缩小了评估中 F1 分数与训练中 dice 损失之间的差距。借助所提出的训练目标,我们在广泛的数据不平衡 NLP 任务上观察到显著的性能提升。值得注意的是,我们在 CTB5、CTB6 和 UD1.4 的词性标注任务上取得了 SOTA 结果;在 CoNLL03、OntoNotes5.0、MSRA 和 OntoNotes4.0 的命名实体识别任务上取得了 SOTA 结果;并在机器阅读理解与复述识别任务上取得了具竞争力的结果。
引用
@article{arxiv.1911.02855,
title = {Dice Loss for Data-imbalanced NLP Tasks},
author = {Xiaoya Li and Xiaofei Sun and Yuxian Meng and Junjun Liang and Fei Wu and Jiwei Li},
journal= {arXiv preprint arXiv:1911.02855},
year = {2020}
}