Conformer 模型用于口语语言理解的不同使用方式研究
计算与语言
2022-04-11 v1 声音
音频与语音处理
摘要
口语语言理解(SLU)结合 ASR 和 NLU 能力以完成语音到意图的理解。在本文中,我们比较了结合 ASR 和 NLU 的不同方式,特别是使用单一 Conformer 模型并以不同方式利用其组件,以更好地理解每种方法的优缺点。我们发现,对于研究或应用而言,最佳系统并不一定是在两阶段解码与端到端系统之间做选择来决定。系统优化仍需要仔细提升每个组件的性能。很难证明某一方向绝对优于另一方向。在本文中,我们还提出了一种新颖的连接主义时间摘要(CTS)方法,以在提升端到端模型准确率和 processing 速度的同时缩短声学编码序列长度。该方法以更低的计算成本实现了与最佳两阶段 SLU 识别(采用复杂且耗时的解码)相同的意图准确率。该堆叠端到端 SLU 系统在 SmartLights 远场集上取得了 93.97% 的意图准确率,在近场集上为 95.18%,在 FluentSpeech 上为 99.71%。
引用
@article{arxiv.2204.03879,
title = {A Study of Different Ways to Use The Conformer Model For Spoken Language Understanding},
author = {Nick J. C. Wang and Shaojun Wang and Jing Xiao},
journal= {arXiv preprint arXiv:2204.03879},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022. (5 pages, 1 figure.)