Tenyidie语音节划语料库的构建与深度学习应用
计算与语言
2025-10-03 v2 人工智能
摘要
Tenyidie语言是印度东北部那加尔邦由Tenyimia社区(Tenyimia Community)讲述的藏域-布尔玛语系低资源语言,属声调语言,主语-宾语-动词(SVO)结构,高度屈从化。作为低资源语言,极少有自然语言处理(NLP)相关研究。据我们所知,尚无关于该语言语音节划(syllabification)的研究报告。语音节划是众多NLP任务之一,旨在识别给定单词的语音节。本工作的贡献在于构建包含10,120个已划分语音节的Tenyidie语料库,并应用于深度学习技术。在数据集划分为80:10:10(训练:验证:测试)的设置下,我们采用LSTM、双向LSTM(BLSTM)、BLSTM+CRF以及编码器-解码器等深度学习架构进行实验。在测试集上,BLSTM模型实现了最高的99.21%准确率。这一工作将为Tenyidie语言的形态学分析、词性标注、机器翻译等众多NLP应用提供支持。
关键词
引用
@article{arxiv.2510.00629,
title = {Tenyidie Syllabification corpus creation and deep learning applications},
author = {Teisovi Angami and Kevisino Khate},
journal= {arXiv preprint arXiv:2510.00629},
year = {2025}
}
备注
17 pages