这套测试集有多难?基于训练动力学的 NLI 基准划分
计算与语言
2024-10-07 v1
摘要
自然语言推理(NLI)评估对于评估语言理解模型至关重要,但流行数据集因存在系统性伪相关性而人为高估实际模型性能。为解决此问题,我们提出了一种无需依赖手动构建人工且不切实际示例的方法,以自动创建具有挑战性的测试集。我们通过利用训练动力学的方法,将流行 NLI 数据集的测试集划分为三个难度级别。这一划分显著降低了伪相关性措施,难度最高的示例表现明显下降,涵盖更真实和多样的语言现象。当 our 方法应用于训练集时,仅使用数据集一部分的数据训练的模型,可达到在完整数据集上训练的模型的性能,超越其他数据集划分技术。我们的研究解决了 NLI 数据集构建的局限性,为评估模型性能提供更真实的评估,具有对 diverse NLU 应用的意义。
引用
@article{arxiv.2410.03429,
title = {How Hard is this Test Set? NLI Characterization by Exploiting Training Dynamics},
author = {Adrian Cosma and Stefan Ruseti and Mihai Dascalu and Cornelia Caragea},
journal= {arXiv preprint arXiv:2410.03429},
year = {2024}
}
备注
Accepted at EMNLP 2024 Main Conference