HeQ:一个大型且多样的以色列阅读理解基准
计算与语言
2025-08-05 v1 人工智能
摘要
当前的以色列自然语言处理(NLP)基准主要聚焦于形态学-句法任务,忽略了语言理解的语义维度。为弥合这一差距,我们构建了一个以抽取式问答形式实现的以色列机器阅读理解(MRC)数据集。由于以色列语的高度凝结性,语域边界的不可确定性和非透明性导致注释不一致、分歧以及标准评估指标中的缺陷。为此,我们设计了一套新颖的指南、受控的众包协议以及适用于高度凝结语种的修订评估指标。我们得到的基准HeQ(以色列问答)包含30,147个多样化的问答对,来自以色列维基百科文章和以色列科技新闻。我们的实证研究表明,诸如F1得分和精确匹配(EM)等标准评估指标不适用于以色列语(以及其他高度凝结语),我们提出了相关的改进方案。此外,我们的实验显示,模型在形态-句法任务上的表现与在MRC任务上的表现之间存在较低的相关性,这表明为前者设计的模型可能在语义密集型任务上表现不佳。HeQ的开发与探索揭示了高度凝结语在自然语言理解(NLU)中所面临的一些挑战,推动了面向以色列语及其他高度凝结语的更好NLU模型的发展。
引用
@article{arxiv.2508.01812,
title = {HeQ: a Large and Diverse Hebrew Reading Comprehension Benchmark},
author = {Amir DN Cohen and Hilla Merhav and Yoav Goldberg and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2508.01812},
year = {2025}
}