零样词性标注配方:在现实场景中有用吗?
计算与语言
2024-10-15 v1
摘要
词性标注在诸多应用中发挥着基本作用。虽然在资源丰富的环境中,词性标注器准确率很高,但在数据有限或缺失的情况下,表现有限。本文聚焦于数据有限的语言的词性标注。我们旨在识别那些在目标语言上不使用任何标记训练数据的情况下,使词性标注模型效果良好的数据集特征。这是一种零样方法。我们比较了在一个或多个与目标语言相关的语言上微调的多语言大型语言模型(mBERT)的准确率。此外,我们还比较了这些结果与直接在目标语言本身上训练的模型。我们对三种目标低资源语言进行了测试。我们的研究突显了准确数据集选择对于有效零样词性标注的重要性。特别是,强烈的语言关系和高质量的数据集有利于获得最佳结果。对于极端低资源语言,零样模型也是可行的选择。
引用
@article{arxiv.2410.10576,
title = {Recipe for Zero-shot POS Tagging: Is It Useful in Realistic Scenarios?},
author = {Zeno Vandenbulcke and Lukas Vermeire and Miryam de Lhoneux},
journal= {arXiv preprint arXiv:2410.10576},
year = {2024}
}
备注
To appear at the 4th Multilingual NLP workshop collocated with EMNLP 2024