利用用户生成数据学习评论生成
计算与语言
2019-02-28 v2
摘要
现有的开放域评论生成模型难以训练,且会产生重复而无趣的回复。该问题源于单篇文章存在多个相互矛盾的回复,以及检索方法的僵化。为解决此问题,我们提出一种结合检索与生成的方法。我们提出一个注意力打分器,通过利用用户生成数据来检索信息丰富且相关的评论。然后,我们将这些评论与文章一起作为带有拷贝机制的序列到序列模型的输入。我们利用大规模评论生成数据集展示了模型的鲁棒性,以及它如何缓解上述问题。结果表明,所提出的生成模型分别比强基线(如带注意力的 Seq2Seq 和 Information Retrieval 模型)显著优于约 27 和 30 个 BLEU-1 点。
引用
@article{arxiv.1810.12264,
title = {Learning Comment Generation by Leveraging User-Generated Data},
author = {Zhaojiang Lin and Genta Indra Winata and Pascale Fung},
journal= {arXiv preprint arXiv:1810.12264},
year = {2019}
}
备注
Accepted by ICASSP 2019