Linguini:用于语言无关语言推理的基准
计算与语言
2024-09-19 v1
摘要
我们提出了一个新的基准,用于衡量语言模型的语言推理能力,而无需依赖现有的语言特定知识。该测试涵盖894个问题,分为160个问题,覆盖75个(主要为极低资源语言),这些问题取自国际语言奥林匹克语料库。要在该基准上获得高准确率,模型不需要对被测试语言的先前知识,因为解决语言谜题所需的所有信息都在上下文中呈现。我们发现,尽管所有分析模型的准确率均低于25%,但在开放模型和封闭模型之间存在显著差距,其中表现最好的专有模型准确率为24.05%,而表现最好的开放模型准确率为8.84%。
引用
@article{arxiv.2409.12126,
title = {Linguini: A benchmark for language-agnostic linguistic reasoning},
author = {Eduardo Sánchez and Belen Alastruey and Christophe Ropers and Pontus Stenetorp and Mikel Artetxe and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2409.12126},
year = {2024}
}