基于神经非似然训练的多样化关键词生成
计算与语言
2020-10-16 v1
摘要
本文从多样性视角研究序列到序列(S2S)关键词生成模型。神经自然语言生成的最新进展使得关键词生成任务取得了显著进步,这通过F1-score等质量指标的提升得以体现。然而,多样性在关键词生成中的重要性在很大程度上被忽视了。我们首先分析了使用最大似然估计(MLE)训练的基线模型所生成输出中存在的信息冗余程度。我们的发现表明,关键词重复是MLE训练的一个主要问题。为缓解该问题,我们采用神经非似然(UL)目标来训练S2S模型。我们所采用的UL训练在以下两个层面运作:(1)目标词元层面,以抑制重复词元的生成;(2)复制词元层面,以避免从源文本复制重复词元。此外,为鼓励解码过程中更好的模型规划,我们引入了K步前瞻词元预测目标,该目标对未来词元同时计算MLE和UL损失。通过在来自三个不同领域的数据集上的大量实验,我们证明了所提方法在保持有竞争力的输出质量的同时,获得了相当可观的多样性提升。
引用
@article{arxiv.2010.07665,
title = {Diverse Keyphrase Generation with Neural Unlikelihood Training},
author = {Hareesh Bahuleyan and Layla El Asri},
journal= {arXiv preprint arXiv:2010.07665},
year = {2020}
}
备注
Accepted to COLING 2020