超越极限:低资源标准形态学分割中的多任务学习与合成数据
计算与语言
2025-05-23 v1
摘要
我们引入了一个基于 Transformer 的形态学分割系统,通过多任务学习和大语言模型生成的合成数据来增强低资源训练信号。该框架联合预测从正字形输入中的形态学分段和 gloss 项,利用通过常见纪录过程获得的共享语言表示来增强模型的泛化能力。为进一步应对数据稀缺问题,我们集成了使用基于情境学习生成的合成训练数据。实验结果表明,在 SIGMORPHON 2023 数据集上,我们的方法在多个低资源语言中显著提高了单词级分割准确率和形态学 F1 分数。
引用
@article{arxiv.2505.16800,
title = {Learning Beyond Limits: Multitask Learning and Synthetic Data for Low-Resource Canonical Morpheme Segmentation},
author = {Changbing Yang and Garrett Nicolai},
journal= {arXiv preprint arXiv:2505.16800},
year = {2025}
}