DuNST:用于半监督可控文本生成的双重噪声自训练方法
计算与语言
2023-06-07 v3
摘要
自训练(ST)在标注数据不足时通过增强预训练语言模型的微调,已在语言理解中再度兴盛。然而,将 ST 纳入属性可控语言生成仍具挑战。仅由自生成伪文本增强的生成模型过度强调对已学空间的利用,受限于狭窄的泛化边界。我们重审 ST 并提出一种新方法 DuNST 以缓解该问题。DuNST 通过共享变分自编码器联合建模文本生成与分类,并以两类灵活噪声污染生成的伪文本以扰动该空间。如此,我们的模型可构建并利用来自给定标签的伪文本与来自可用无标签文本的伪标签,二者在 ST 过程中逐步精炼。我们从理论上证明 DuNST 可视为增强对潜在真实文本空间的探索,为性能提升提供保证。在三个可控生成任务上的实验表明,相较于若干强基线,DuNST 能显著提升控制准确率,同时保持可比的生成流畅度与多样性。
引用
@article{arxiv.2212.08724,
title = {DuNST: Dual Noisy Self Training for Semi-Supervised Controllable Text Generation},
author = {Yuxi Feng and Xiaoyuan Yi and Xiting Wang and Laks V. S. Lakshmanan and Xing Xie},
journal= {arXiv preprint arXiv:2212.08724},
year = {2023}
}