基于 Sinc 卷积从原始音频数据进行轻量级端到端语音识别
音频与语音处理
2020-10-19 v2 声音
信号处理
摘要
许多端到端自动语音识别(ASR)系统仍依赖手工设计的频域特征,以模拟人类听觉。我们的工作受近期可集成可学习特征提取进展的启发。为此,我们提出轻量级 Sinc 卷积(LSC),将 Sinc 卷积与深度可分离卷积相结合,作为端到端 ASR 系统的低参数量机器学习特征提取器。我们将 LSC 集成到混合 CTC/注意力架构中进行评估。所得端到端模型展现出平滑的收敛行为,通过在时域应用 SpecAugment 得到进一步改善。我们还讨论了滤波器层面的改进,例如使用对数压缩作为激活函数。我们的模型在 TEDlium v2 测试集上实现了 10.7% 的词错误率,相较采用 log-mel 滤波器组特征的对应架构绝对提升 1.9%,而模型大小仅为其 21%。
引用
@article{arxiv.2010.07597,
title = {Lightweight End-to-End Speech Recognition from Raw Audio Data Using Sinc-Convolutions},
author = {Ludwig Kürzinger and Nicolas Lindae and Palle Klewitz and Gerhard Rigoll},
journal= {arXiv preprint arXiv:2010.07597},
year = {2020}
}
备注
Accepted at INTERSPEECH 2020