NLU 基准测试综述:为何不标准化诊断性基准测试?
计算与语言
2025-07-29 v1 人工智能
人机交互
机器学习
摘要
自然语言理解 (NLU) 是自然语言处理 (NLP) 中的基础任务。NLU 能力的评估近年来成为备受关注的研究主题,推动了众多基准测试的开发。这些基准测试包括各种任务和数据集,用于通过公开排行榜评估预训练模型的结果。值得注意的是,一些基准测试包含诊断数据集,旨在对广泛的语言现象进行调查和细粒度错误分析。本综述提供了对现有英文、阿拉伯语和多语言 NLU 基准测试的全面回顾,特别强调其诊断数据集及其覆盖的语言现象。我们对这些基准测试进行详细的比较与分析,突出其在评估 NLU 任务方面的优势与局限,并深入剖析错误模式。在指出现有方法的不足时,我们注意到宏观类别和微观类别缺乏命名规范,甚至没有标准化的语言现象集合。因此,我们提出了一个关于诊断性基准测试评估指标的研究问题:"我们为何不为 NLU 评估诊断基准测试制定评估标准?"(类似行业中的 ISO 标准)。我们深入分析并比较所涵盖的语言现象,以支持未来构建语言现象全局层级结构的专家。我们认为,为诊断评估建立评估指标将有助于在不同诊断基准测试之间更深入地比较模型结果。
引用
@article{arxiv.2507.20419,
title = {Survey of NLU Benchmarks Diagnosing Linguistic Phenomena: Why not Standardize Diagnostics Benchmarks?},
author = {Khloud AL Jallad and Nada Ghneim and Ghaida Rebdawi},
journal= {arXiv preprint arXiv:2507.20419},
year = {2025}
}