一种脚本替代数百种?关于预训练罗马化编码器语言模型
计算与语言
2026-01-12 v1
摘要
通过暴露潜在的词汇重叠,脚本罗马化已成为改善多语言语言模型(mLMs)中跨语言迁移(XLT)的有效策略。然而,大多数先前的工作都集中在最有利于罗马化的设置上:(1) 从高资源拉丁文字语言到低资源非拉丁文字语言的迁移,和/或 (2) 在谱系上密切相关但使用不同文字的语言之间进行迁移。因此,目前尚不清楚罗马化是否是预训练通用多语言语言模型的一个良好表征选择,或者更准确地说,与罗马化相关的信息损失是否会损害高资源语言的性能。我们通过从头开始为六种类型学上多样的高资源语言在罗马化文本和原始文本上预训练编码器语言模型来弥补这一差距,研究两个潜在的退化来源:(i) 文字特定信息的损失和 (ii) 词汇重叠增加带来的负面跨语言干扰。使用两个具有不同保真度配置文件的罗马化器,我们观察到对于使用音段文字的语言,性能损失可以忽略不计,而使用语素音节文字的语言(中文和日文)则遭受退化,更高保真度的罗马化可以缓解但无法完全恢复这种退化。重要的是,通过比较单语言语言模型与其多语言对应模型,我们没有发现证据表明增加的子词重叠会引发负面干扰。我们进一步表明,罗马化以可忽略的性能代价提高了分段文字语言的编码效率(即繁殖力)。
引用
@article{arxiv.2601.05776,
title = {One Script Instead of Hundreds? On Pretraining Romanized Encoder Language Models},
author = {Benedikt Ebing and Lennart Keller and Goran Glavaš},
journal= {arXiv preprint arXiv:2601.05776},
year = {2026}
}