一种面向低资源文本生成的半监督方法
计算与语言
2019-06-04 v1
摘要
近年来,编码器-解码器神经模型在文本生成任务上取得了巨大成功。然而,此类模型的一个问题在于其性能通常受限于标注良好数据的规模,而获取这类数据代价高昂。标注数据低资源的问题在不同文本生成任务中十分常见,但未标注数据通常十分丰富。本文提出一种方法,利用未标注数据在低资源条件下提升此类模型的性能。我们使用去噪自编码器(DAE)和基于语言模型(LM)的强化学习(RL),借助未标注数据增强编码器与解码器的训练。我们的方法对不同文本生成任务表现出适应性,并在基础文本生成模型上取得了显著提升。
引用
@article{arxiv.1906.00584,
title = {A Semi-Supervised Approach for Low-Resourced Text Generation},
author = {Hongyu Zang and Xiaojun Wan},
journal= {arXiv preprint arXiv:1906.00584},
year = {2019}
}
备注
Finished in 2017, a foundation work for "Massive Styles Transfer with Limited Labeled Data"