面向字符级数据到文本生成的拷贝机制与定制训练
机器学习
2020-05-12 v4 计算与语言
神经与进化计算
机器学习
摘要
在过去几年中,许多不同的方法聚焦于使用深度循环神经网络进行自然语言生成。最广泛使用的序列到序列神经方法是基于词的:因此,它们需要一个称为去词汇化(反之,再词汇化)的预处理步骤来处理不常见或未知词。然而,这些处理形式产生了依赖于所用词汇且并非完全神经化的模型。在本工作中,我们提出了一个带有注意力机制的端到端序列到序列模型,该模型在字符级别进行读取和生成,不再需要去词汇化、分词,甚至也不需要小写化。此外,由于字符构成了每种文本的共同“构建块”,它也允许更通用的文本生成方法,使得利用迁移学习进行训练成为可能。这些能力得益于两个主要特性:(i) 在标准生成机制与拷贝机制之间切换的可能性,允许直接拷贝输入事实以产生输出;(ii) 使用一种原创的训练流程,进一步提升了生成文本的质量。我们还引入了一个称为 E2E+ 的新数据集,旨在突出基于字符模型的拷贝能力,它是 E2E Challenge 中使用的知名 E2E 数据集的修改版本。我们根据五个广泛接受的指标(包括广泛使用的 BLEU)测试了我们的模型,表明其相对于基于字符和基于词的方法均取得了有竞争力的性能。
引用
@article{arxiv.1904.11838,
title = {Copy mechanism and tailored training for character-based data-to-text generation},
author = {Marco Roberti and Giovanni Bonetta and Rossella Cancelliere and Patrick Gallinari},
journal= {arXiv preprint arXiv:1904.11838},
year = {2020}
}
备注
ECML-PKDD 2019 (Camera ready version)