中文

面向资源受限关键短语生成的表示学习

计算与语言 2022-10-25 v3

摘要

最先进的关键短语生成方法通常依赖于大规模标注数据集,这限制了其在标注数据有限的领域中的性能。为克服此挑战,我们设计了一种面向数据的方法,首先利用基于检索的语料级统计识别显著信息,然后基于预训练语言模型使用大规模无标注文档学习任务特定的中间表示。我们引入显著跨度恢复与显著跨度预测作为去噪训练目标,以凝练关键短语生成所必需的文内与文间知识。通过在多个关键短语生成基准上的实验,我们展示了所提方法在促进低资源关键短语生成与零样本域适应方面的有效性。我们的方法尤其有益于缺失关键短语的生成,逼近使用大规模训练集训练的模型性能。

关键词

引用

@article{arxiv.2203.08118,
  title  = {Representation Learning for Resource-Constrained Keyphrase Generation},
  author = {Di Wu and Wasi Uddin Ahmad and Sunipa Dev and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2203.08118},
  year   = {2022}
}

备注

EMNLP 2022 (Findings)