中文

文字系统敏感性:在 Unicode、罗马化及混合文字僧伽罗语上对语言模型的基准测试

计算与语言 2026-05-11 v3 人工智能

摘要

语言模型在僧伽罗语等低资源、形态丰富语言上的性能在很大程度上尚未被探索,尤其是在数字通信中的文字系统变体方面。僧伽罗语表现出文字系统二元性,在正式语境中使用 Unicode,在社交媒体中罗马化文本占主导地位,而混合文字使用在实践中很常见。本文对 24 个开源语言模型在 Unicode、罗马化和混合文字僧伽罗语上进行了基准测试,使用跨多种文本来源的困惑度评估。结果揭示了显著的文字系统敏感性,从 Unicode 到罗马化文本,中位性能下降超过 300 倍。关键的是,模型规模与文字处理能力不具相关性,较小的模型通常优于大 28 倍的架构。Unicode 性能强烈预测混合文字鲁棒性,但不能预测罗马化能力,这表明单文字系统评估大幅低估了实际部署的挑战。这些发现确立了语言模型在僧伽罗语上的基线能力,并为多文字低资源环境中的模型选择提供了实用指导。

关键词

引用

@article{arxiv.2601.14958,
  title  = {Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala},
  author = {Minuri Rajapakse and Ruvan Weerasinghe},
  journal= {arXiv preprint arXiv:2601.14958},
  year   = {2026}
}

备注

Published at SCSE 2026 (9th IEEE International Research Conference on Smart Computing and Systems Engineering). Best Paper Award - Text Analytics Track