塔吉克语词性标注基准测试:基于 TajPersParallel 语料的神经架构比较研究
计算与语言
2026-05-07 v1
摘要
本文提出了针对塔吉克语自动词性标注(POS)任务的第一个基准测试。尽管现有的多语言语言模型在世界上许多语言上都展现出了很高的有效性,但它们对塔吉克语的语法分析能力至今仍未被探索。本研究旨在通过系统比较经典神经网络架构和现代多语言 Transformer 来填补这一空白。实验在 TajPersParallel 语料库上进行,这是一个包含约 44,000 个词典条目的平行词汇资源。由于当前版本的语料库缺乏完整的例句,该任务是在孤立词汇单元层面进行的,属于一种具有挑战性的上下文无关分类。研究比较了以下架构:循环 BiLSTM-CRF 模型,以及采用参数高效微调方法 LoRA 适配的多语言模型 XLM-RoBERTa (large)、mBERT、ParsBERT(波斯语)和 ruBERT(俄语)。测试结果表明,mBERT + LoRA 模型取得了最佳性能(macro F1-score = 0.11,weighted F1-score = 0.62)。研究发现,在缺乏句法上下文的情况下,所有模型在解决形态歧义方面都存在显著困难,主要能成功分类高频词类(“名词”、“形容词”),而对罕见功能词的有效性为零。零样本评估揭示了塔吉克语与波斯语(ParsBERT)和俄语(ruBERT)在类型学上的最大接近度。所得结果为塔吉克语自动处理领域的进一步研究与发展奠定了基础。
引用
@article{arxiv.2605.04576,
title = {Benchmarking POS Tagging for the Tajik Language: A Comparative Study of Neural Architectures on the TajPersParallel Corpus},
author = {Mullosharaf K. Arabov},
journal= {arXiv preprint arXiv:2605.04576},
year = {2026}
}
备注
Preprint