基于注意力的 Wav2Text 与特征迁移学习
计算与语言
2017-09-25 v1 机器学习
声音
摘要
传统的自动语音识别(ASR)通常执行多级模式识别任务,将声学语音波形映射到语音单元的层次结构中。但众所周知,早期阶段的信息丢失会传播到后续阶段。在深度学习复兴之后,人们对开发一种从原始波形到转录的纯端到端 ASR 系统的可能性产生了兴趣,无需任何预定义对齐和手工设计的模型。然而,端到端架构的成功尝试仍使用基于频谱的特征,而使用原始波形的成功尝试仍基于混合深度神经网络-隐马尔可夫模型(DNN-HMM)框架。在本文中,我们构建了第一个基于注意力的端到端编码器-解码器模型,直接从原始语音波形处理到文本转录。我们将该模型称为“基于注意力的 Wav2Text”。为了辅助端到端模型的训练过程,我们提出利用特征迁移学习。实验结果还表明,所提出的基于注意力的 Wav2Text 模型直接使用原始波形,与在标准前端滤波器组特征上训练的注意力编码器-解码器模型相比,可以获得更好的结果。
引用
@article{arxiv.1709.07814,
title = {Attention-based Wav2Text with Feature Transfer Learning},
author = {Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:1709.07814},
year = {2017}
}
备注
Accepted at ASRU 2017