中文

评估大型语言模型在多语言和代码切换语境下的多词表达能力

计算与语言 2025-04-30 v1

摘要

多词表达以非组合性意义和句法不规则性为特征,是一种细腻的语言现象。这些表达可以以字面或习语方式使用,导致意义发生显著变化。尽管大型语言模型在众多任务上已显示出强大的性能,但其处理此类语言细微差别的能力仍存疑问。因此,本研究评估了最新语言模型处理潜在习语多词表达歧义的能力,尤其是在模型较少依赖记忆的、较不常见的语境中。通过评估葡萄牙语、加利亚利语以及英语中的模型表现,并使用新构建的代码切换数据集和新任务,我们发现尽管大型语言模型具有优势,但在处理细腻语言方面仍面临挑战。特别地,我们发现最新的模型,包括 GPT-4,在检测和语义任务中均未超过 xlm-roBERTa-base 的基线模型,在我们引入的新任务上表现尤为糟糕,尽管这些任务与现有任务相似。总体而言,我们的结果表明,多词表达,尤其是存在歧义的表达,仍然是模型面临的挑战。

关键词

引用

@article{arxiv.2504.20051,
  title  = {Evaluating Large Language Models on Multiword Expressions in Multilingual and Code-Switched Contexts},
  author = {Frances Laureano De Leon and Harish Tayyar Madabushi and Mark G. Lee},
  journal= {arXiv preprint arXiv:2504.20051},
  year   = {2025}
}