NagaNLP: 基于人机协同合成数据启动低资源 Nagamese Creole 的 NLP
计算与语言
2025-12-16 v1
摘要
世界上绝大多数语言,特别是像 Nagamese 这样的克里奥尔语,在自然语言处理 (NLP) 中仍然严重资源不足,这对其在数字技术中的表示构成了重大障碍。本文介绍了 NagaNLP,一个针对 Nagamese 的综合性开源工具包,通过一种依赖 LLM 驱动但由人工验证的合成数据生成的新方法启动。我们详细描述了一个多阶段流水线,其中专家引导的 LLM (Gemini) 生成候选语料库,然后由母语者进行精炼和标注。这种合成-混合方法产生了 10K 对对话数据集和一个用于基础任务的高质量标注语料库。为评估我们方法的有效性,我们训练了判别式和生成式模型。我们微调的 XLM-RoBERTa-base 模型为 Nagamese 建立了新基准,在词性标注上达到 93.81% 准确率 (0.90 F1-Macro),在命名实体识别上达到 0.75 F1-Macro,大幅超越了强大的零样本基线。此外,我们微调了一个名为 NagaLLaMA 的 Llama-3.2-3B Instruct 模型,该模型在对话任务上展现出优越性能,达到困惑度 3.85,相比其少样本对应模型 (96.76) 提升了一个数量级。我们发布了 NagaNLP 工具包,包括所有数据集、模型和代码,为一个此前服务不足的语言提供了基础资源,并为减少其他低资源场景中的数据稀缺提供了一个可复现的框架。
引用
@article{arxiv.2512.12537,
title = {NagaNLP: Bootstrapping NLP for Low-Resource Nagamese Creole with Human-in-the-Loop Synthetic Data},
author = {Agniva Maiti and Manya Pandey and Murari Mandal},
journal= {arXiv preprint arXiv:2512.12537},
year = {2025}
}