奥克语方言正字法变体的建模
计算与语言
2024-05-01 v1
摘要
有效地规范化文本数据是一个相当大的挑战,尤其是对于缺乏标准化书写系统的低资源语言。在本研究中,我们使用来自几种奥克语方言的数据微调了一个多语言模型,并进行了一系列实验来评估模型对这些方言的表示。为了评估,我们编译了一个涵盖四种奥克语方言的平行词汇表。对模型嵌入的内在评估表明,方言之间的表面相似性增强了表示。当模型进一步微调用于词性标注和通用依存句法分析时,其性能对方言变体具有鲁棒性,即使仅使用单一方言的词性数据进行训练也是如此。我们的研究结果表明,大型多语言模型在预处理过程中最大限度地减少了拼写规范化的需求。
引用
@article{arxiv.2404.19315,
title = {Modeling Orthographic Variation in Occitan's Dialects},
author = {Zachary William Hopton and Noëmi Aepli},
journal= {arXiv preprint arXiv:2404.19315},
year = {2024}
}
备注
Accepted at VarDial 2024: The Eleventh Workshop on NLP for Similar Languages, Varieties and Dialects