通过可训练基函数理解音频特征
声音
2022-04-26 v1 音频与语音处理
信号处理
摘要
在本文中,我们探索通过使谱图基函数可训练来最大化谱图所表示信息的可能性。我们在两个不同任务上进行实验,即关键词 spotting(KWS)与自动语音识别(ASR)。对于大多数神经网络模型,其架构与超参数通常在实验中精细调整与优化。然而,输入特征常被视为固定。在音频情况下,信号主要可通过两种方式表达:原始波形(时域)或谱图(时频域)。此外,常使用不同的谱图类型并针对不同的应用进行定制。在我们的实验中,我们将这种定制作为网络的一部分直接允许。实验结果表明,使用可训练基函数可将关键词 spotting(KWS)准确率提升14.2个百分点,并将音素错误率(PER)降低9.5个百分点。尽管随着模型复杂度增加,使用可训练基函数的模型变得效果较差,但训练得到的滤波器形状仍可为我们在该特定任务中哪些频带重要提供见解。从实验中我们可得出结论:当模型复杂度受限时,可训练基函数是提升性能的有用工具。
引用
@article{arxiv.2204.11437,
title = {Understanding Audio Features via Trainable Basis Functions},
author = {Kwan Yee Heung and Kin Wai Cheuk and Dorien Herremans},
journal= {arXiv preprint arXiv:2204.11437},
year = {2022}
}
备注
under review in Interspeech 2022