面向领域泛化口语不流畅检测的多任务学习方法及其在对话系统中的应用
计算与语言
2018-10-09 v1
摘要
自发的口语对话常常是不流畅的,包含停顿、犹豫、自我纠正和无效开头。处理这些现象对于理解说话者的意图含义以及控制对话流程至关重要。此外,这种处理需要逐词增量式进行,以便进一步的下游处理能够尽早开始,从而应对真实自发的人的对话行为。另外,从开发者的角度来看,非常希望开发出能够从“干净”样本中训练、同时又能泛化到同一数据上极为多样的不流畅变体的系统——从而提升数据效率与鲁棒性。在本文中,我们提出一种基于 LSTM 的多任务模型,用于不流畅结构的增量式检测,该模型可接入任意增量式解释组件(例如增量式语义解析器),或者仅用于在话语生成过程中对其“清理”。我们在 Switchboard Dialogue Acts (SWDA) 语料库上训练该系统,并给出其在该数据集上的准确率。我们的模型在 SWDA 上以更简单的架构比先前基于神经网络的增量式方法高出约 10 个百分点。为测试模型的泛化潜力,我们在 bAbI+ 数据集上评估同一模型,且未进行任何额外训练。bAbI+ 是一个合成的目标导向对话数据集,其中我们控制了不流畅现象及其类型的分布。这表明我们的方法具有良好的泛化潜力,并进一步揭示了哪些类型的不流畅可能适用于领域泛化处理。
引用
@article{arxiv.1810.03352,
title = {Multi-Task Learning for Domain-General Spoken Disfluency Detection in Dialogue Systems},
author = {Igor Shalyminov and Arash Eshghi and Oliver Lemon},
journal= {arXiv preprint arXiv:1810.03352},
year = {2018}
}
备注
9 pages, 1 figure, 7 tables. Accepted as a full paper for SemDial 2018