中文

生成式大语言模型的丹麦语素养

计算与语言 2025-03-05 v2 人工智能 机器学习

摘要

生成式大语言模型(GLLMs)的语言技术“登月时刻”并不局限于英语:这些模型也为低资源语言带来了技术应用、投资和炒作的热潮。然而,直到最近,由于缺乏可用的评估语料库,这些模型在丹麦语等语言上的能力仍难以在定性演示之外得到验证。我们提出了一个用于评估“丹麦语素养”(Danoliteracy)的GLLM基准,该指标衡量在八个不同场景下的丹麦语言和文化能力,例如丹麦公民身份测试和抽象性社交媒体问答。我们发现,这个有限规模的基准能够产生一个稳健的排名,该排名与人类反馈的相关性在GPT-4和Claude Opus模型上达到 ρ0.8\rho \sim 0.8,且这两个模型获得了最高排名。通过分析这些模型在不同场景下的结果,我们发现一个强大的潜在因素解释了GLLMs在丹麦语中 95%95\% 的场景性能差异,这暗示了模型在语言适应方面存在一个一致性的 gg 因子。

关键词

引用

@article{arxiv.2410.22839,
  title  = {Danoliteracy of Generative Large Language Models},
  author = {Søren Vejlgaard Holm and Lars Kai Hansen and Martin Carsten Nielsen},
  journal= {arXiv preprint arXiv:2410.22839},
  year   = {2025}
}

备注

16 pages, 13 figures, Accepted to NoDaLiDa/Baltic-HLT 2025