基于语义框架注释的阅读理解任务评估方法论
计算与语言
2025-01-30 v1
摘要
我们介绍一种基于阅读理解任务的评估方法论,核心思想是某些示例因其语言复杂性,无论模型规模或体系结构如何,都常常得分较低。我们利用语义框架注释来刻画这种复杂性,并研究七种可能解释模型困难的因素。我们首先在一个经过仔细注释的法语阅读理解基准测试上部署了该方法,发现其中两种复杂性因素确实是模型失败的良好预测器,而其他因素则作用较小。我们进一步在一个已广泛研究的英语基准测试上采用 Chat-GPT 作为语义注释的代理人。我们的研究表明,基于细粒度语言动机的自动评估阅读理解任务是可行的,这有助于理解模型处理输入示例特定语言特征的能力。它还表明当前的状态最先进模型在处理这些特征时会失败,这表明仅靠增加模型规模而不足以充分处理这些特征。
引用
@article{arxiv.2501.17569,
title = {A linguistically-motivated evaluation methodology for unraveling model's abilities in reading comprehension tasks},
author = {Elie Antoine and Frédéric Béchet and Géraldine Damnati and Philippe Langlais},
journal= {arXiv preprint arXiv:2501.17569},
year = {2025}
}