中文

在基于注意力 LSTM 的系统中结合声学谱图与调制谱图用于语音可懂度等级分类

音频与语音处理 2024-02-06 v1 机器学习

摘要

语音可懂度可能受多种因素影响,如噪声环境、信道失真或生理问题。本文致力于解决后一种情况下的语音可懂度等级自动预测问题。基于我们之前针对该任务设计的带有注意力机制的 LSTM 网络非侵入式系统,我们提出了两项主要贡献。第一项贡献是提出使用逐帧调制谱图作为输入特征,替代那些丢弃重要时间信息的紧凑表示。第二项贡献是探索了将逐帧声学 log-mel 谱图和调制谱图结合到 LSTM 框架中的两种不同策略:决策级(或晚期融合)和话语级(或加权池化 WP 融合)。所提出的模型在包含不同严重程度构音障碍语音的 UA-Speech 数据库上进行了评估。一方面,结果表明注意力 LSTM 网络能够对调制谱图序列进行充分建模,产生与 log-mel 谱图相当的分类率。另一方面,晚期融合和 WP 融合这两种结合策略均优于单特征系统,表明逐帧 log-mel 谱图和调制谱图携带了互补信息,可供基于 LSTM 的架构有效利用,其中采用 WP 融合策略和注意力池化的系统取得了最佳结果。

关键词

引用

@article{arxiv.2402.02865,
  title  = {On combining acoustic and modulation spectrograms in an attention LSTM-based system for speech intelligibility level classification},
  author = {Ascensión Gallardo-Antolín and Juan M. Montero},
  journal= {arXiv preprint arXiv:2402.02865},
  year   = {2024}
}