中文

基于集值预测的历史语料库可靠词性标注

计算与语言 2024-10-30 v4 信息检索 机器学习 机器学习

摘要

以词性(POS)标签形式对语料库进行句法标注,是语言学研究及后续自动化自然语言处理(NLP)任务的关键前提。该问题通常通过机器学习方法解决,即在足够大的标注数据语料库上训练词性标注器。尽管现代语言的词性标注问题基本上可视为已解决,但历史语料库难度要大得多,尤其是由于缺乏母语使用者和训练数据稀疏。此外,大多数文本没有我们今天所知的句子,也没有统一的拼写规范。这些不规则性使得自动化词性标注任务更加困难且容易出错。在此情形下,不应强迫词性标注器预测并锁定单一标签,而应使其能表达自身的不确定性。本文在集值预测框架下研究词性标注,该框架允许词性标注器通过预测一组候选词性标签而非猜测单一标签来表达其不确定性。目标是在保持候选数量较小的同时,保证正确词性标签被包含在内的高置信度。在实验研究中,我们发现将最先进的词性标注器扩展为集值预测可得到更精确和鲁棒的标注,尤其针对未知词(即未出现在训练数据中的词)。

关键词

引用

@article{arxiv.2008.01377,
  title  = {Reliable Part-of-Speech Tagging of Historical Corpora through Set-Valued Prediction},
  author = {Stefan Heid and Marcel Wever and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2008.01377},
  year   = {2024}
}

备注

14 pages, 8 figures