中文

法语语言理解评估综合基准 COLE

计算与语言 2025-10-08 v2

摘要

为满足对法语自然语言理解 (NLU) 更全面评估的需求, 我们引入 COLE, 一个包含 23 个多样化任务的新基准, 涵盖情感分析、改写检测、语法判断和推理等广泛的 NLU 能力, 特别关注与法语语言相关的语言现象。我们对 94 个大型语言模型 (LLM) 进行基准测试, 对当前法语 NLU 状态进行了广泛分析。我们的结果表明, 封闭型和开放型权重模型之间的性能存在显著差距, 并确定了当前大型语言模型面临的关键挑战, 如零样本抽取式问答 (QA)、细粒度词义消歧和理解区域语言变体。我们将 COLE 以公共资源形式发布, 以推动法语语言建模的进一步进展。

关键词

引用

@article{arxiv.2510.05046,
  title  = {COLE: a Comprehensive Benchmark for French Language Understanding Evaluation},
  author = {David Beauchemin and Yan Tremblay and Mohamed Amine Youssef and Richard Khoury},
  journal= {arXiv preprint arXiv:2510.05046},
  year   = {2025}
}

备注

Submitted to ACL Rolling Review of October