用于不流畅检测的多任务自监督学习
计算与语言
2020-04-10 v2
摘要
大多数现有的不流畅检测方法严重依赖人工标注数据,而这类数据在实践中获取成本高昂。为应对训练数据瓶颈,我们研究了组合多个自监督任务的方法——即数据可无需人工标注而收集的监督任务。首先,我们通过从未标注新闻数据中随机添加或删除词来构建大规模伪训练数据,并提出两个自监督预训练任务:(i) 用于检测所添加噪声词的标注任务;(ii) 用于区分原始句子与语法错误句子的句子分类任务。随后我们组合这两个任务联合训练一个网络。该预训练网络然后使用人工标注的不流畅检测训练数据进行微调。在常用英语 Switchboard 测试集上的实验结果表明,我们的方法仅使用不到 1%(1000 句)的训练数据即可取得与先前系统(使用完整数据集训练)相竞争的性能。我们在完整数据集上训练的方法显著优于先前方法,在英语 Switchboard 上将错误率降低了 21%。
引用
@article{arxiv.1908.05378,
title = {Multi-Task Self-Supervised Learning for Disfluency Detection},
author = {Shaolei Wang and Wanxiang Che and Qi Liu and Pengda Qin and Ting Liu and William Yang Wang},
journal= {arXiv preprint arXiv:1908.05378},
year = {2020}
}