面向双方对话的跨注意力端到端语音识别
音频与语音处理
2019-07-26 v1 计算与语言
机器学习
声音
摘要
我们提出了一种端到端语音识别模型,该模型基于说话轮次切换信息学习两名说话人之间的交互。与传统的语音识别模型不同,我们的模型在端到端框架内利用了跨越多个轮次的双方说话人对话上下文历史信息。具体而言,我们提出了一种说话人特定的跨注意力机制,该机制能够关注另一方说话人的输出以及当前说话人的输出,以更好地识别长对话。我们在 Switchboard 对话语音语料库上评估了这些模型,并表明我们的模型优于标准的端到端语音识别模型。
引用
@article{arxiv.1907.10726,
title = {Cross-Attention End-to-End ASR for Two-Party Conversations},
author = {Suyoun Kim and Siddharth Dalmia and Florian Metze},
journal= {arXiv preprint arXiv:1907.10726},
year = {2019}
}
备注
Interspeech 2019