中文

仅使用单语语料的无监督跨语言词性标记

计算与语言 2026-02-11 v1

摘要

由于词性标注数据的稀缺,现有研究在低资源语言上通常采用无监督方法进行词性标记。其中,基于词对齐的词性投影方法通过平行语料将高资源源语言的词性标签投影到低资源目标语言,从而特别适用于低资源语言场景。然而,该方法高度依赖平行语料,而许多低资源语言缺乏平行语料。为克服这一限制,我们提出一种完全无监督的跨语言词性 (POS) 标记框架,仅依赖单语语料,借助无监督神经机器翻译 (UNMT) 系统。该 UNMT 系统首先将高资源语言的句子翻译成目标语言,从而构建伪平行句子对。随后,遵循标准的投影程序并基于词对齐训练目标语言的词性标注器。此外,我们提出一种多源投影技术,用于校准目标侧的投影词性标签,从而提升词性标注器的训练效果。我们在 28 个语言对上进行评估,覆盖四个源语言(英语、德语、西班牙语和法语)和七个目标语言(南非荷兰语、巴斯科语、芬兰语、印尼语、立陶宅语、葡萄牙语和土耳其语)。实验结果表明,我们的方法可实现与带平行句子对的基线跨语言词性标注器相当的性能,甚至在某些目标语言上超越基线。此外,我们提出的多源投影技术进一步提升了性能,平均提升约 1.3%。

关键词

引用

@article{arxiv.2602.09366,
  title  = {Unsupervised Cross-Lingual Part-of-Speech Tagging with Monolingual Corpora Only},
  author = {Jianyu Zheng},
  journal= {arXiv preprint arXiv:2602.09366},
  year   = {2026}
}

备注

16 pages, 6 figures, 7 tables, under review