面向机器阅读理解的训练集免费评估基准调查
计算与语言
2024-08-12 v1
摘要
NLP 系统的性能通常通过收集大规模数据集(通过众包)来训练数据驱动模型并在保留数据的一部分上进行评估来评估。这一方法已显示出虚假关联和缺乏代表自然语言多样性的具有挑战性的示例的问题。相反,我们检查了在合成挑战集合上对优化模型进行训练集免费评估的框架。我们发现,尽管生成方法简单,数据在自然性和词汇多样性方面仍能与众包数据集相抗衡,适用于评估机器阅读理解模型的语言能力。我们进一步进行实验,表明最先进的基于语言模型的 MRC 系统可以正确地在挑战集合上取得成功,尽管未能捕捉所评估现象的普遍概念。
引用
@article{arxiv.2408.05023,
title = {Investigating a Benchmark for Training-set free Evaluation of Linguistic Capabilities in Machine Reading Comprehension},
author = {Viktor Schlegel and Goran Nenadic and Riza Batista-Navarro},
journal= {arXiv preprint arXiv:2408.05023},
year = {2024}
}