中文

语言模型是否盲目借词?对10种语言中借词识别的多语言评估

计算与语言 2026-03-04 v2

摘要

在语言史过程中,词语会从一种语言借入另一种语言,并逐渐融入受借入方的词典。说话者通常能够区分借词和本土词汇,尤其是在双语社区中,主导语言不断对少数语言施加词汇压力的情况下。这篇论文考察了预训练语言模型,包括大型语言模型,是否具备类似的借词识别能力。我们在10种语言上对多种模型进行评估。尽管提供了明确的指令和上下文信息,我们的结果显示,这些模型在区分借词和本土词汇方面表现不佳。这一发现 corroborates( corroborate )了先前的证据,即现代 NLP 系统对借词表现出偏好而非本土等价物。我们的工作对开发面向少数语言的 NLP 工具、支持处于主导语言词汇压力下的社区的语言保存具有意义。

关键词

引用

@article{arxiv.2510.26254,
  title  = {Are Language Models Borrowing-Blind? A Multilingual Evaluation of Loanword Identification across 10 Languages},
  author = {Mérilin Sousa Silva and Sina Ahmadi},
  journal= {arXiv preprint arXiv:2510.26254},
  year   = {2026}
}

备注

Accepted at LREC 2026