中文

从文本中学习关键短语的丰富表示

计算与语言 2022-07-12 v2 信息检索 机器学习

摘要

在本文中,我们探索如何训练面向从文本文档中学习关键短语丰富表示的特定任务语言模型。我们在判别与生成两种设定下,尝试了不同的掩码策略来预训练 transformer 语言模型(LMs)。在判别设定中,我们引入一种新的预训练目标——带替换的关键短语边界填充(KBIR),当使用 KBIR 预训练的 LM 微调用于关键短语抽取任务时,相较 SOTA 取得了大幅性能提升(F1 最高提升 8.16 点)。在生成设定中,我们为 BART 引入一种新的预训练设置——KeyBART,其以 CatSeq 格式复现与输入文本相关的关键短语,而非去噪的原始输入。这同样在关键短语生成上带来了相较 SOTA 的性能提升(F1@M 最高提升 4.33 点)。此外,我们还将预训练语言模型微调于命名实体识别(NER)、问答(QA)、关系抽取(RE)、抽象式摘要等任务,并取得了与 SOTA 相当的性能,表明学习关键短语的丰富表示确实有益于许多其他基础 NLP 任务。

关键词

引用

@article{arxiv.2112.08547,
  title  = {Learning Rich Representation of Keyphrases from Text},
  author = {Mayank Kulkarni and Debanjan Mahata and Ravneet Arora and Rajarshi Bhowmik},
  journal= {arXiv preprint arXiv:2112.08547},
  year   = {2022}
}