利用词混淆网络为对话状态跟踪建模 ASR 歧义
计算与语言
2022-04-11 v2 机器学习
声音
音频与语音处理
摘要
口语对话系统通常使用一组前 N 个 ASR 假设来推断语义含义并跟踪对话状态。然而,ASR 图(如混淆网络(confnets))相比前 N 个 ASR 列表提供了更丰富假设空间的紧凑表示。本文中,我们研究了在最先进的神经对话状态跟踪器(DST)中使用混淆网络的益处。我们使用一种注意力混淆网络编码器将二维 confnet 编码为一维嵌入序列,该编码器可与任何 DST 系统配合使用。我们的 confnet 编码器被插入最先进的“全局-局部自注意力对话状态跟踪器”(GLAD)模型中进行 DST,与使用前 N 个 ASR 假设相比,在准确率和推理时间上均获得显著提升。
引用
@article{arxiv.2002.00768,
title = {Modeling ASR Ambiguity for Dialogue State Tracking Using Word Confusion Networks},
author = {Vaishali Pal and Fabien Guillot and Manish Shrivastava and Jean-Michel Renders and Laurent Besacier},
journal= {arXiv preprint arXiv:2002.00768},
year = {2022}
}
备注
Accepted at Interspeech-2020