C2C-GenDA:用于槽填充数据增强的簇到簇生成方法
计算与语言
2020-12-15 v1 人工智能
摘要
槽填充作为口语理解的基础模块,常受训练数据数量与多样性不足之苦。为此,我们提出一种新颖的用于数据增强(DA)的簇到簇生成框架,名为 C2C-GenDA。它通过将在保持语义的前提下将已有话语重构为替代表达来扩充训练集。不同于以往逐条独立重构话语的 DA 工作,C2C-GenDA 联合编码同一语义的多个已有话语并同时解码多个未见表达。联合生成多个新话语可考虑生成实例间的关系并促进多样性。此外,编码多个已有话语赋予 C2C 对已有表达更广阔的视野,有助于减少与已有数据重复的生成。在 ATIS 与 Snips 数据集上的实验表明,当仅有数百条训练话语时,经 C2C-GenDA 增强的实例分别将槽填充的 F 值提升 7.99(11.9%)与 5.76(13.6%)。
引用
@article{arxiv.2012.07004,
title = {C2C-GenDA: Cluster-to-Cluster Generation for Data Augmentation of Slot Filling},
author = {Yutai Hou and Sanyuan Chen and Wanxiang Che and Cheng Chen and Ting Liu},
journal= {arXiv preprint arXiv:2012.07004},
year = {2020}
}
备注
Accepted by AAAI-2021