面向濒危语言记录的混合神经-LLM 形态学标注管线:以俞瓦塔语为例
计算与语言
2026-03-03 v1
摘要
Interlinear glossed text(IGT)制作是语言记录与野外调查中的主要瓶颈,尤其是针对低资源且形态结构复杂的语言。我们提出一种混合自动标注管线,结合神经序列标注与大语言模型(LLM)后期纠错,在俞瓦塔语(一种低资源突尼斯语族语言)上进行评估。通过系统消融实验发现,检索增强式提示显著优于随机示例选择。我们进一步发现,形态学词典在大多数情况下反而有害于性能,而性能随few-shot示例数量约为对数关系。最重要的是,结合BiLSTM-CRF模型与LLM后期纠错的两阶段管线显著提升标注效果,大幅减少人工标注工作量。基于这些发现,我们确立了将结构化预测模型与LLM推理集成于形态复杂野外语境中的具体设计原则,表明混合架构为濒危语言记录中的自动语言标注提供了可行路径。
引用
@article{arxiv.2603.00923,
title = {Hybrid Neural-LLM Pipeline for Morphological Glossing in Endangered Language Documentation: A Case Study of Jungar Tuvan},
author = {Siyu Liang and Talant Mawkanuli and Gina-Anne Levow},
journal= {arXiv preprint arXiv:2603.00923},
year = {2026}
}