中文

面向巴尔蒂语国家的开源语言模型本地化评估

计算与语言 2025-01-08 v1 人工智能

摘要

虽然大型语言模型(LLMs)已改变我们对现代语言技术的期望,但数据隐私问题常常限制了来自欧盟司法管辖区之外的商业 LLM 的使用。这限制了其在政府、国防及其他数据敏感领域的应用。本文评估了可本地部署的开源权重 LLM 对立陶宛、拉脱维亚和爱沙尼亚等次主要语言的支持程度。我们检验了顶尖多语言开源权重模型(Llama~3、Gemma~2、Phi 和 NeMo)的 various size and precision variants 在机器翻译、多选题回答和自由文本生成上的表现。结果表明,尽管某些模型如 Gemma~2 在接近顶尖商业模型方面表现良好,但许多 LLM 在这些语言方面仍表现不佳。最令人惊讶的是,我们发现这些模型虽然在接近最先进的翻译性能方面表现良好,但仍容易出现词汇幻觉,在所有开源多语言 LLM 中至少 1 在 20 个词中都会出现错误。

关键词

引用

@article{arxiv.2501.03952,
  title  = {Localizing AI: Evaluating Open-Weight Language Models for Languages of Baltic States},
  author = {Jurgita Kapočiūtė-Dzikienė and Toms Bergmanis and Mārcis Pinnis},
  journal= {arXiv preprint arXiv:2501.03952},
  year   = {2025}
}

备注

This paper is accepted to NoDaLiDa/Baltic-HLT 2025