利用注意力与混合单元改进基于 CTC 的声学到词模型
计算与语言
2019-09-06 v2
摘要
基于连接主义时序分类(CTC)准则的声学到词模型是一种自然的端到端(E2E)系统,直接以词作为输出单元。该系统中存在两个问题:首先,CTC 模型当前输出依赖于当前输入,未考虑上下文加权输入,这是硬对齐问题。其次,基于词的 CTC 模型存在词表外(OOV)问题,这意味着它只能对频繁出现的词建模,而将其余词标记为 OOV。因此,此类模型在识别固定频繁词集合方面的能力有限。在本研究中,我们提出使用注意力机制与混合单元相结合来解决这些问题。具体而言,我们引入了注意力 CTC、自注意力 CTC、混合 CTC 和混合单元 CTC。首先,我们通过注意力 CTC 和自注意力 CTC 将注意力建模能力直接融入 CTC 网络。其次,为缓解 OOV 问题,我们提出混合 CTC,其使用具有共享隐藏层的词和字母 CTC;当词 CTC 发出 OOV 时,混合 CTC 求助于字母 CTC。然后,我们提出了一个更好的方案,通过训练混合单元 CTC,将所有 OOV 词分解为频繁词和多字母单元的序列。在 3400 小时的 Microsoft Cortana 语音助手任务上评估,我们最终的利用注意力和混合单元的声学到词方案相比原始词 CTC 在词错误率(WER)上实现了 12.09% 的相对降低。这种不使用任何语言模型(LM)或复杂解码器的 E2E 模型,也以 6.79% 的相对优势超越了带有强 LM 和解码器的传统上下文相关(CD)音素 CTC。
引用
@article{arxiv.1812.11928,
title = {Advancing Acoustic-to-Word CTC Model with Attention and Mixed-Units},
author = {Amit Das and Jinyu Li and Guoli Ye and Rui Zhao and Yifan Gong},
journal= {arXiv preprint arXiv:1812.11928},
year = {2019}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing