既用文本又得其用!具备语义保真度的端到端神经数据到文本生成
计算与语言
2020-11-12 v2
摘要
端到端神经数据到文本(D2T)生成最近作为基于流水线架构的替代方案出现。然而,它在泛化到新领域和生成语义一致的文本方面面临挑战。在本工作中,我们提出 DataTuner,一个神经的、端到端的数据到文本生成系统,它对数据表示和目标领域做出最小假设。我们采取两阶段生成-重排序方法,将微调语言模型与语义保真度分类器相结合。我们的每个组件都是端到端学习的,无需特定于数据集的启发式方法、实体去词汇化或后处理。我们表明,DataTuner 在四个主要 D2T 数据集(LDC2017T10、WebNLG、ViGGO 和 Cleaned E2E)的自动化指标上取得了最先进的结果,且由人类标注者评估的流畅度接近或超过了人工撰写的参考文本。我们进一步证明,DataTuner 中基于模型的语义保真度打分器相比传统的、基于启发式的度量是一种更好的评估工具。我们生成的文本在所有四个数据集上相比最先进水平具有显著更好的语义保真度。
引用
@article{arxiv.2004.06577,
title = {Have Your Text and Use It Too! End-to-End Neural Data-to-Text Generation with Semantic Fidelity},
author = {Hamza Harkous and Isabel Groves and Amir Saffari},
journal= {arXiv preprint arXiv:2004.06577},
year = {2020}
}
备注
28th International Conference on Computational Linguistics (COLING 2020), Online, December 8-13, 2020