中文

用于标题词性标注的跨语域投影方法

计算与语言 2021-09-17 v1 人工智能

摘要

词性(POS)标注是熟知的自然语言处理(NLP)任务。最先进的标注器在新闻正文体上 routinely 达到超过 97% 的 token 级准确率,证明该问题已被充分理解。然而,英文新闻标题的语域“标题体”与长文本语域截然不同,导致 POS 标注模型在标题上表现不佳。本工作中,我们通过从新闻正文中对应句子投影预测标签,自动用 POS 标签标注新闻标题。我们在长文本和标题文本上训练一个多语域 POS 标注器,并展示在两个语域上的联合训练优于仅在单一语域训练或朴素拼接训练集。我们在一个新标注的、来自 Google 句子压缩语料的超过 5,248 条英文新闻标题语料上评估,显示我们的模型带来每 token 23% 的相对错误降低和每标题 19% 的降低。此外,我们证明更好的标题 POS 标签可提升基于句法的开放信息抽取系统性能。我们公开 POSH(带 POS 标签的标题语料)以促进面向新闻标题的改进 NLP 模型研究。

关键词

引用

@article{arxiv.2109.07483,
  title  = {Cross-Register Projection for Headline Part of Speech Tagging},
  author = {Adrian Benton and Hanyang Li and Igor Malioutov},
  journal= {arXiv preprint arXiv:2109.07483},
  year   = {2021}
}

备注

EMNLP 2021