用于数据稀疏 NLU 中标注数据增强的生成对抗网络
计算与语言
2020-12-11 v1 机器学习
摘要
数据稀疏是会话智能体自然语言理解(NLU)模型开发中的关键挑战之一。由于监督学习通常要求高质量的标注语句,这一挑战更加复杂,往往导致数周的手动标注与高昂成本。本文中,我们展示了通过采用序列生成对抗网络(GAN)进行训练数据增强来提升 NLU 模型性能的结果。我们在两项任务背景下探索数据生成:新语言的引导启动与低资源特征的处理。针对两项任务,我们探索了三种序列 GAN 架构,一种带 token 级奖励函数,一种带我们自行实现的 token 级蒙特卡洛展开奖励,第三种带句子级奖励。我们评估了这些反馈模型在多种采样方法下的性能,并将结果与将原始数据上采样至相同规模进行比较。我们通过预训练嵌入的迁移学习进一步提升了 GAN 模型性能。我们的实验表明,使用序列生成对抗网络生成的合成数据在多项指标上带来显著性能提升,并可对 NLU 任务产生重大裨益。
引用
@article{arxiv.2012.05302,
title = {Generative Adversarial Networks for Annotated Data Augmentation in Data Sparse NLU},
author = {Olga Golovneva and Charith Peris},
journal= {arXiv preprint arXiv:2012.05302},
year = {2020}
}
备注
8 pages; accepted for the ICON 2020 (17th International Conference on Natural Language Processing)