LombardoGraphia:Lombard orthography variants 的自动分类
计算与语言
2026-03-31 v1
摘要
Lombard 是一种在意大利北部和瑞士南部约有380万人口的次资源语言种类,缺乏统一的正字法标准。存在多种正字法系统,为 NLP 资源开发和模型训练带来了挑战。本文提出了对 Lombard 正字法分类和 LombardoGraphia 的首次研究。LombardoGraphia 是一个包含 11,186 份 Lombard 维基百科样本、跨 9 种正字法变体标记的精选语料库,以及用于自动正字法分类的模型。我们策划了该数据集,处理和过滤原始维基百科内容,以确保文本适合正字法分析。我们训练了 24 个传统和神经分类模型,采用 various features and encoding levels。我们的最佳模型在整体和平均类别准确率上分别达到 96.06% 和 85.78%,尽管在少数类上的性能仍具有挑战性,由于数据不平衡。我们的工作为为 Lombard 构建 variety-aware NLP 资源提供了至关重要的基础设施。
关键词
引用
@article{arxiv.2603.28418,
title = {LombardoGraphia: Automatic Classification of Lombard Orthography Variants},
author = {Edoardo Signoroni and Pavel Rychlý},
journal= {arXiv preprint arXiv:2603.28418},
year = {2026}
}
备注
To be published at LREC 2026