大语言模型是否了解卢森堡语的借词?探究低资源多语言模型中的词汇新造词
计算与语言
2026-05-21 v1
摘要
大型语言模型 (LLM) 越来越多地被用于小型接触语言的写作辅助,但是否遵守社区关于词汇借词和新造词的规范却不为人知。我们引入 LexNeo-Bench,这是一个由 3,050 个实例构成的 token 级基准测试,源自 LuxBorrow—a 大型卢森堡语新闻语料库,其中目标 token 被标记为本土词或来自法语、德语或英语的借词。使用该基准,我们在 34 个 prompt 设置下探究了三种多语言 LLM:借词类型分类和二元词汇创新代理 (借词 vs 本土词)。在无外部上下文情况下,模型仅在借词分类上略高于随机水平,因此我们构建了包含捐赠语言、形态学模式和词类类比的语言知识图谱,并将特定子图注入 prompt。知识图谱式 prompt 将借词分类准确率从 25--35% 提升至 71--81%,基本消除小模型与大模型之间的差距,但在新造词检测方面仍保持困难且对 few-shot 设计敏感。我们的结果表明,词汇感知式 prompt 对在低资源接触语言中进行稳健的借词判断至关重要,词汇资源可作为 LLM 评估的结构化上下文。本研究在 ENEOLI COST Action 中进行,探讨了作为词汇创新的一种形式——借词——在多语言卢森堡语数据中的表现。
引用
@article{arxiv.2605.21227,
title = {Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models},
author = {Nina Hosseini-Kivanani},
journal= {arXiv preprint arXiv:2605.21227},
year = {2026}
}
备注
Accepted to Neollm colocated with LREC2026, Three figures and three tables