中文

乌古语语言学基础依存树库的构建与教育应用

计算与语言 2026-01-21 v2

摘要

为低资源的屈�折性语言如乌古语开发有效的教育技术常面临现有注释框架与特定语法结构之间的不匹配挑战。为此,本研究引入现代乌古语依存树库 (MUDT),一种专为捕捉乌古语的屈�折性复杂性而设计的语言学基础注释框架,包括零系表构式和细粒度 case 标记。利用将大型语言模型预注释与严格的人类校正相结合的混合管线,构建了由 3,456 句子组成的高质量树库。内在结构评估显示,MUDT 通过将通用依赖关系 (Universal Dependencies) 标准中的跨弧率从 7.35% 降低到 0.06% 来显著提高依赖项目化程度。对 UDPipe 和 Stanza 的外推解析实验进一步表明,在域内准确率和跨域泛化方面,训练于 MUDT 的模型优于基于 UD 的基线模型。为验证此计算资源的实际用途,我们开发了一个基于 MUDT 的语法分析转化为可解释教育反馈的 AI 辅助语法辅导系统。一个涉及 35 名二语学习者的受控实验表明,接受语法感知反馈的学生在学习收益方面显著优于对照组。这一发现确立了 MUDT 作为语法分析稳健基础,并凸显了语言学信息化自然语言处理资源在弥合计算模型与二语学习者认知需求之间起到的关键作用。

关键词

引用

@article{arxiv.2507.21536,
  title  = {Construction and educational application of a linguistically grounded dependency treebank for Uyghur},
  author = {Jiaxin Zuo and Yiquan Wang and Yuan Pan and Xiadiya Yibulayin},
  journal= {arXiv preprint arXiv:2507.21536},
  year   = {2026}
}