紧扣事实:面向忠实数据到文本生成的置信解码
计算与语言
2020-11-03 v3
摘要
我们处理数据到文本生成中的幻觉问题,即减少生成不受源数据支持的文本。我们推测幻觉可由编码器-解码器模型在生成内容短语时不注意源数据而引起;因此我们提出一种置信分数以确保模型在必要时注意源数据,以及一种可从数据学习该分数的变分贝叶斯训练框架。在 WikiBio(Lebret 等,2016)数据集上的实验表明,根据 PARENT 分数(Dhingra 等,2019)与人工评估,我们的方法比现有最先进方法更忠实于源数据。我们亦报告在 WebNLG(Gardent 等,2017)数据集上的强劲结果。
引用
@article{arxiv.1910.08684,
title = {Sticking to the Facts: Confident Decoding for Faithful Data-to-Text Generation},
author = {Ran Tian and Shashi Narayan and Thibault Sellam and Ankur P. Parikh},
journal= {arXiv preprint arXiv:1910.08684},
year = {2020}
}