中文

FIBER:用于事实推理偏差评估的多语言资源

计算与语言 2025-12-15 v1 人工智能

摘要

大型语言模型在各领域被广泛使用,但人们对其事实可靠性和偏差存在担忧。事实知识探测提供了一种系统评估这些方面的手段。大多数现有基准聚焦于单实体事实和单语言数据。因此,我们提出了 FIBER,一个用于评估单实体和多实体设置中事实知识的多语言基准。该数据集包含英语、意大利语和土耳其语中的句子补全、问答和对象计数预测任务。使用 FIBER,我们检验提示语言是否在实体选择中诱发推理偏差,以及大型语言模型在多实体问题与单实体问题上的表现。结果表明,提示语言可以影响模型生成的输出,特别是对于与该语言对应国家相关的实体。然而,这种效应在不同主题上有所不同,31% 的主题表现出大于 0.5 的事实推理偏差分数。此外,偏差水平因语言而异,土耳其语提示在 83% 的主题上表现出比意大利语更高的偏差,表明存在语言依赖模式。我们的结果还表明,模型在处理多实体问题时比单实体问题面临更大困难。模型性能因语言和模型规模而异。最高的平均精度在英语中取得,而土耳其语和意大利语导致明显较低的分数。较大模型(包括 Llama-3.1-8B 和 Qwen-2.5-7B)始终优于较小的 3B-4B 模型。

关键词

引用

@article{arxiv.2512.11110,
  title  = {FIBER: A Multilingual Evaluation Resource for Factual Inference Bias},
  author = {Evren Ayberk Munis and Deniz Yılmaz and Arianna Muti and Çağrı Toraman},
  journal= {arXiv preprint arXiv:2512.11110},
  year   = {2025}
}