DATASHI:面向正字规范化与低资源语言处理的平行英语-塔什利亚特语语料库
计算与语言
2026-03-24 v1
摘要
DATASHI 是一个新的平行英语-塔什利亚特语语料库,填补了阿马齐亚语言(Amazigh languages)计算资源中的关键缺口。它包含 5,000 句对,其中包括 1,500 句带有专家标准化和非标准用户生成版本的子集,支持系统性研究正字多样性和规范化。这种双重设计支持基于文本的 NLP 任务——如分词、翻译和规范化——并可作为面向语音数据收集和多模态对齐的基础。针对最新大型语言模型(GPT-5、Claude-Sonnet-4.5、Gemini-2.5-Pro、Mistral、Qwen3-Max)进行全面评估,显示从 zero-shot 到 few-shot 提示都有明显改进,Gemini-2.5-Pro 取得最低的词和字符级错误率,并表现出稳健的跨语言泛化能力。对 edit 操作(删除、替换和插入)进行细粒度分析,跨越音位类别(双音、重音、齣音和喉音)进一步揭示了模型对标记塔什利亚特特征的特定敏感性,并为低资源阿马齐亚正字规范化提供了新的诊断性见解。
引用
@article{arxiv.2603.21571,
title = {DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing},
author = {Nasser-Eddine Monir and Zakaria Baou},
journal= {arXiv preprint arXiv:2603.21571},
year = {2026}
}
备注
This paper has been accepted for presentation at LREC 2026