端到端声学至语义转导
计算与语言
2021-05-20 v1 声音
音频与语音处理
摘要
在本文中,我们提出了一种新颖的基于注意力机制的端到端序列到序列口语理解模型。它可靠地选择上下文声学特征以推断语义内容。我们设计并测试了一种能够从声学片段中提取所有发音词与概念的初始架构。借助浅融合语言模型,该系统在法语 MEDIA 语料库上达到了 13.6 的概念错误率(CER)和 18.5 的概念值错误率(CVER),相比当前最优方法绝对降低了 2.8 个百分点。随后,我们提出了一种用于推断概念及其值的原始模型。该转导在无任何新型上下文的情况下达到了 15.4 的 CER 和 21.6 的 CVER。
引用
@article{arxiv.2102.01013,
title = {End2End Acoustic to Semantic Transduction},
author = {Valentin Pelloin and Nathalie Camelin and Antoine Laurent and Renato De Mori and Antoine Caubrière and Yannick Estève and Sylvain Meignier},
journal= {arXiv preprint arXiv:2102.01013},
year = {2021}
}
备注
Accepted at IEEE ICASSP 2021