面向改进口语语言理解的对话历史端到端集成
计算与语言
2022-04-12 v1 人工智能
摘要
在对话系统中,对话历史对口语语言理解(SLU)性能起着重要作用。对于端到端(E2E)SLU,已有工作以文本形式利用对话历史,这使得模型依赖于级联的自动语音识别器(ASR)。这取消了E2E系统本应紧凑且对ASR错误鲁棒的优势。本文提出一种分层对话模型,能够直接以语音形式利用对话历史,从而实现完全E2E。我们还通过联合训练一个类似的基于文本的对话模型并显式绑定声学与语义嵌入,从可用的黄金对话转写文本中蒸馏语义知识。我们还提出一种称为DropFrame的新技术,以应对以E2E方式加入对话历史所带来的长训练时间。在HarperValleyBank对话数据集上,我们的E2E历史集成在对话动作识别任务上比无历史依赖的基线绝对F1分数高出7.7%。我们的模型与最先进的基于历史的级联基线竞争力相当,但参数量减少了48%。在缺乏黄金转写文本来微调ASR模型时,我们的模型比该基线绝对F1分数高出显著的10%。
引用
@article{arxiv.2204.05169,
title = {Towards End-to-End Integration of Dialog History for Improved Spoken Language Understanding},
author = {Vishal Sunder and Samuel Thomas and Hong-Kwang J. Kuo and Jatin Ganhotra and Brian Kingsbury and Eric Fosler-Lussier},
journal= {arXiv preprint arXiv:2204.05169},
year = {2022}
}
备注
5 pages, 1 figure