计算频谱的极旧方法:在端到端ASR中的应用
音频与语音处理
2021-04-06 v2 声音
摘要
我们提出一种使用频域线性预测(FDLP)计算语谱图的技术,该技术利用全极点模型在不同频率子带中拟合语音的平方希尔伯特包络。完整语音片段的语谱图通过相邻全极点模型响应的重叠相加计算。1.5秒的长上下文窗使我们能在语谱图中捕获语音的低频时间调制。对于端到端自动语音识别任务,在干净朗读语音的训练和测试数据上,FDLP语谱图与标准梅尔语谱图特征表现相当。对于存在训练-测试域失配或混响的更真实语音数据,FDLP语谱图相较梅尔语谱图分别显示出高达25%和22%的相对词错率(WER)提升。
引用
@article{arxiv.2103.14129,
title = {Radically Old Way of Computing Spectra: Applications in End-to-End ASR},
author = {Samik Sadhu and Hynek Hermansky},
journal= {arXiv preprint arXiv:2103.14129},
year = {2021}
}
备注
submitted to INTERSPEECH 2021