LuxBorrow:从 Pompier 到 Pompjee,追踪卢森堡语中借词
计算与语言
2026-03-17 v2
摘要
我们提出了 LuxBorrow,这是一套针对卢森堡语(LU)新闻(1999-2025 年,涵盖 27 年)的借词优先分析,涉及 259,305 篇 RTL 文章和 43.7M 标记。我们的管道将句子级语言识别(LU/DE/FR/EN)与受限于 LU 句子的标记级借词解析器结合起来,利用词形还原、收集的借词注册表以及编译的形态学和拼写规则。经验上,LU 始终是所有文档中的矩阵语言,而多语言实践则十分普遍:77.1% 的文章包含至少一个捐赠语言,65.4% 的文章使用三到四种语言。广度并不等于强度:中位数代码混合指数(CMI)从 3.90(LU+1)上升至仅 7.00(LU+3),表明为局部插入而非均衡的双语文本。领域和时期概述显示,混合现象呈中等但持续的趋势,CMI 从 6.1(1999-2007 年)上升至 2020 年的峰值 8.4。标记级适应总计 25,444 实例,呈现混合特征:形态学 63.8%,拼写 35.9%,词汇 0.3%。最常见的单个规则是拼写规则,如 on->oun 和 eur->er,而形态学在整体上占主导地位。历时性地,代码切换趋于加剧,形态学适应的借词从小基数开始增长。法语几乎所有提供适应项目,德语增长适度,英语则可忽略不计。我们主张采用以借词为中心的评估,包括借词标记和类型率、捐赠方��(针对借词项目)以及同化比率,而非仅依赖文档级混合指数。
引用
@article{arxiv.2603.10789,
title = {LuxBorrow: From Pompier to Pompjee, Tracing Borrowing in Luxembourgish},
author = {Nina Hosseini-Kivanani and Fred Philippy},
journal= {arXiv preprint arXiv:2603.10789},
year = {2026}
}
备注
Paper got accepted to LREC2026, 4 Figures and 2 Tables