中文

QFrCoLA:一个魁北克法语语言可接受性判断语料库

计算与语言 2025-08-26 v1

摘要

大型基于 Transformer 的语言模型在各种下游任务中表现卓越。然而,关于这些模型如何内化语言知识的了解仍有限,因此最近提出了各种语言基准测试以促进跨语言语法评估。本文介绍 QFrCoLA(魁北克法语语言可接受性判断语料库),这是一个由 25,153 条域内和 2,675 条域外句子组成的规范性二元可接受性判断数据集。我们的研究利用 QFrCoLA 数据集以及七个其他语言二元可接受性判断语料库,对比评估了七个语言模型。结果表明,针对大多数语言,微调的基于 Transformer 的语言模型是大多数任务的强基线,而零样本二元分类大型语言模型在该任务上表现不佳。然而,在 QFrCoLA 基准测试中,平均而言,微调的基于 Transformer 的语言模型超过了测试的其他方法。它还显示,为本次实验挑选的预训练跨语言大型语言模型在训练期间似乎未获得针对魁北克法语的语言判断能力。最终,我们的实验结果显示 QFrCoLA 数据集是基于揭示语言规范而非说话者情感的示例构建的,其类似于语言可接受性判断;这是一个具有挑战性的数据集,可用于衡量语言模型在其语言判断能力方面的表现。

关键词

引用

@article{arxiv.2508.16867,
  title  = {QFrCoLA: a Quebec-French Corpus of Linguistic Acceptability Judgments},
  author = {David Beauchemin and Richard Khoury},
  journal= {arXiv preprint arXiv:2508.16867},
  year   = {2025}
}

备注

Accepted to EMNLP 2025