面向客户关怀口语理解的自动数据扩展
计算与语言
2018-10-02 v1
摘要
口语理解(SLU)系统被广泛用于处理客户关怀来电。传统的 SLU 系统由用于解码话语的声学模型(AM)和语言模型(LM),以及预测意图的自然语言理解(NLU)模型组成。虽然 AM 可跨不同领域共享,但 LM 和 NLU 模型需要针对每个新任务专门训练。然而,准备足够数据来训练这些模型成本高昂。在本文中,我们引入一种高效方法来扩展有限的领域内数据。该过程始于基于领域内数据、采用逻辑回归训练一个初步 NLU 模型。由于特征基于 n=1,2-gram,我们可以检测出每个意图类别最具信息量的 n-gram。利用这些 n-gram,我们在域外语料中找到:1)包含所需 n-gram 和/或 2)具有相似意图标签的样本。满足第一约束的样本用于训练新 LM 模型,同时满足两个约束的样本用于训练新 NLU 模型。我们在两个差异显著的实验设置上的结果表明,相较于初步模型,所提方法将绝对分类错误率(CER)降低了 30%,并且显著优于基于半监督学习、TF-IDF 和嵌入向量的传统数据扩展算法。
引用
@article{arxiv.1810.00670,
title = {Automatic Data Expansion for Customer-care Spoken Language Understanding},
author = {Shahab Jalalvand and Andrej Ljolje and Srinivas Bangalore},
journal= {arXiv preprint arXiv:1810.00670},
year = {2018}
}
备注
10 pages, 4 figures, 5 tabels