我们需要谈谈NLP中的分类评估指标
计算与语言
2024-01-09 v1 机器学习
摘要
在自然语言处理(NLP)的分类任务(如主题分类和情感分析)中,模型的泛化能力通常使用准确率、F-Measure或AUC-ROC等标准指标来衡量。指标的多样性及其应用的随意性表明,NLP领域内尚未就单一最佳指标达成共识。这种缺失意味着尚未对每个指标所编码的底层启发式规则进行充分检验。为了解决这个问题,我们将几个标准分类指标与更“异类”的指标进行比较,并证明随机猜测归一化的Informedness指标是衡量任务性能的一个简约基线。为了展示指标选择的重要性,我们在广泛的NLP任务上进行了大量实验,包括合成场景、自然语言理解、问答和机器翻译。在这些任务中,我们使用一组超集指标对模型进行排名,发现Informedness最能捕捉理想的模型特征。最后,我们发布了遵循SciKitLearn分类器格式的Informedness的Python实现。
引用
@article{arxiv.2401.03831,
title = {We Need to Talk About Classification Evaluation Metrics in NLP},
author = {Peter Vickers and Loïc Barrault and Emilio Monti and Nikolaos Aletras},
journal= {arXiv preprint arXiv:2401.03831},
year = {2024}
}
备注
Appeared in AACL 2023