中文

LuxBorrow:从 Pompier 到 Pompjee,追踪卢森堡语中借词

计算与语言 2026-03-17 v2

摘要

我们提出了 LuxBorrow,这是一套针对卢森堡语(LU)新闻(1999-2025 年,涵盖 27 年)的借词优先分析,涉及 259,305 篇 RTL 文章和 43.7M 标记。我们的管道将句子级语言识别(LU/DE/FR/EN)与受限于 LU 句子的标记级借词解析器结合起来,利用词形还原、收集的借词注册表以及编译的形态学和拼写规则。经验上,LU 始终是所有文档中的矩阵语言,而多语言实践则十分普遍:77.1% 的文章包含至少一个捐赠语言,65.4% 的文章使用三到四种语言。广度并不等于强度:中位数代码混合指数(CMI)从 3.90(LU+1)上升至仅 7.00(LU+3),表明为局部插入而非均衡的双语文本。领域和时期概述显示,混合现象呈中等但持续的趋势,CMI 从 6.1(1999-2007 年)上升至 2020 年的峰值 8.4。标记级适应总计 25,444 实例,呈现混合特征:形态学 63.8%,拼写 35.9%,词汇 0.3%。最常见的单个规则是拼写规则,如 on->oun 和 eur->er,而形态学在整体上占主导地位。历时性地,代码切换趋于加剧,形态学适应的借词从小基数开始增长。法语几乎所有提供适应项目,德语增长适度,英语则可忽略不计。我们主张采用以借词为中心的评估,包括借词标记和类型率、捐赠方��(针对借词项目)以及同化比率,而非仅依赖文档级混合指数。

关键词

引用

@article{arxiv.2603.10789,
  title  = {LuxBorrow: From Pompier to Pompjee, Tracing Borrowing in Luxembourgish},
  author = {Nina Hosseini-Kivanani and Fred Philippy},
  journal= {arXiv preprint arXiv:2603.10789},
  year   = {2026}
}

备注

Paper got accepted to LREC2026, 4 Figures and 2 Tables