自然语言处理基准质量相关参数综述
计算与语言
2022-10-17 v1 计算机视觉与模式识别
摘要
为追踪 NLP 领域的进展,已投入大量资源构建若干基准。针对这些基准发表的数千篇论文竞相登顶排行榜,模型常超越人类表现。然而,近期研究表明,模型仅靠在虚假偏置上过拟合便能在多个流行基准上取胜,并未真正学习任务。尽管有此发现,基准构建在试图应对偏置时仍依赖权宜之计,因丢弃低质量数据而未充分利用建基准所投资源,且覆盖有限偏置集合。解决这些问题的潜在方案——量化质量的指标——仍鲜有探索。受电力、食品、水等多个领域成功质量指标的启发,我们通过识别可表征基准中导致偏置的各类可能交互的某些语言属性,朝该指标迈出第一步。我们寻找与偏置相关的参数,其有望铺就通向该指标之路。我们调研已有工作,识别捕捉偏置各类属性、其来源、类型及对性能、泛化与鲁棒性影响的参数。分析横跨数据集及从 NLI 到摘要的层次化任务,确保参数具通用性且非过拟合于特定任务或数据集。此过程中我们也发展了若干参数。
引用
@article{arxiv.2210.07566,
title = {A Survey of Parameters Associated with the Quality of Benchmarks in NLP},
author = {Swaroop Mishra and Anjana Arunkumar and Chris Bryan and Chitta Baral},
journal= {arXiv preprint arXiv:2210.07566},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2005.00816