利用自动标注的质量加权弱监督联合改进语言理解与生成
计算与语言
2021-02-09 v1 人工智能
摘要
神经自然语言生成(NLG)与理解(NLU)模型数据需求量大,需要大量标注数据才具竞争力。近期框架通过以规模合成弱标签的生成模型解决此瓶颈,其中少量训练标签由专家策划,其余数据自动标注。我们遵循该方法,用微调的GPT-2自动构建大规模弱标注数据,并采用半监督框架联合训练NLG与NLU模型。所提框架根据估计的标签质量调整对模型的参数更新。在E2E和Weather基准上,我们表明该弱监督训练范式在低资源场景下是有效方法,且在100%训练数据使用时在两个数据集上均优于基准系统。
引用
@article{arxiv.2102.03551,
title = {Jointly Improving Language Understanding and Generation with Quality-Weighted Weak Supervision of Automatic Labeling},
author = {Ernie Chang and Vera Demberg and Alex Marin},
journal= {arXiv preprint arXiv:2102.03551},
year = {2021}
}
备注
Accepted at EACL2021