Triple-to-Text:通过优化逆 KL 散度将 RDF 三元组转换为高质量自然语言
计算与语言
2019-06-06 v1 人工智能
摘要
知识库是以结构化方式表示信息的主要形式之一。知识库通常由描述实体及其关系的资源描述框架(RDF)三元组构成。生成知识库的自然语言描述是 NLP 中的一项重要任务,其已被形式化为条件语言生成任务并使用序列到序列(sequence-to-sequence)框架加以解决。当前工作大多通过最大似然估计训练语言模型,这往往生成质量低劣的句子。在本文中,我们认为最大似然估计的此类问题是内在的,通常无法通过改变网络结构来补救。相应地,我们提出了一种新颖的 Triple-to-Text(T2T)框架,其近似优化真实句子与生成句子分布之间的逆 Kullback-Leibler(KL)散度。由于逆 KL 对看起来虚假的样本施加较大惩罚的性质,所提方法能显著降低生成低质量句子的概率。我们在三个真实世界数据集上的实验表明,T2T 能生成更高质量的句子,并在若干评价指标上优于基线模型。
引用
@article{arxiv.1906.01965,
title = {Triple-to-Text: Converting RDF Triples into High-Quality Natural Languages via Optimizing an Inverse KL Divergence},
author = {Yaoming Zhu and Juncheng Wan and Zhiming Zhou and Liheng Chen and Lin Qiu and Weinan Zhang and Xin Jiang and Yong Yu},
journal= {arXiv preprint arXiv:1906.01965},
year = {2019}
}