中文

索拉尼库尔德语文本中的习语检测

计算与语言 2025-08-19 v4

摘要

习语检测使用自然语言处理(NLP)是通过计算机化过程识别文本中超出字面意义的修辞表达。尽管习语检测在 various languages 中取得了显著进展,但库尔德语在该领域仍面临显著研究空白,尽管习语在机器翻译和情感分析等任务中至关重要。本研究以文本分类任务的方式,使用深度学习技术针对索拉尼库尔德语进行习语检测。为此,我们开发了一个包含10,580句话、涵盖101个索拉尼库尔德语习语的语料库。基于该语料库,我们开发并评估了三个深度学习模型:KuBERT-based变换器序列分类、循环卷积神经网络(RCNN),以及带注意力机制的双向长短期记忆网络(BiLSTM)。评估结果显示,变换器模型(即微调的BERT)始终优于其他模型,准确率几乎达到99%,而RCNN达到96.5%,BiLSTM达到80%。这些结果凸显了基于变换器的架构在低资源语言(如库尔德语)中的有效性。这一研究提供了语料库、三个优化模型以及习语检测的见解,为推动库尔德语NLP的发展奠定了基础。

关键词

引用

@article{arxiv.2501.14528,
  title  = {Idiom Detection in Sorani Kurdish Texts},
  author = {Skala Kamaran Omer and Hossein Hassani},
  journal= {arXiv preprint arXiv:2501.14528},
  year   = {2025}
}

备注

22 pages, 8 figures, 7 tables