中文

零资源跨语言词性标注

计算与语言 2024-01-12 v1

摘要

在零资源环境下进行词性标注,对于没有标注训练数据的低资源语言来说是一种有效的方法。现有系统主要使用两种技术进行词性标注,即预训练的多语言大语言模型(LLM),或将源语言标签投影到零资源目标语言中,并在其上训练序列标注模型。我们探索了后一种方法,使用现成的对齐模块,并训练隐马尔可夫模型(HMM)来预测词性标签。我们评估了以英语为源语言,法语、德语和西班牙语为目标语言的词性标注迁移学习设置。我们的结论是,零资源语言中的投影对齐数据有助于预测词性标签。

关键词

引用

@article{arxiv.2401.05727,
  title  = {Zero Resource Cross-Lingual Part Of Speech Tagging},
  author = {Sahil Chopra},
  journal= {arXiv preprint arXiv:2401.05727},
  year   = {2024}
}