中文

基于典型相关与深度学习的新型语音可懂度增强模型

声音 2022-02-14 v1 机器学习 音频与语音处理

摘要

当前基于深度学习(DL)的噪声环境下语音可懂度增强方法通常训练为最小化无噪语音与增强语音信号之间的特征距离。尽管改善了语音质量,此类方法在日常噪声环境中未能达到所需语音可懂度水平。面向可懂度(I-O)的损失函数近来被开发用于训练 DL 方法以实现鲁棒语音增强。在此,我们首次公式化了一种新颖的基于典型相关的 I-O 损失函数,以更有效地训练 DL 算法。具体而言,我们提出一种基于典型相关的短时客观可懂度(CC-STOI)代价函数来训练全卷积神经网络(FCN)模型。我们进行了对比仿真实验,表明在使用针对未知说话人与噪声的客观与主观评价指标时,我们基于 CC-STOI 的语音增强框架优于用传统基于距离和基于 STOI 的损失函数训练的 SOTA DL 模型。正在进行的未来工作是评估所提方法在鲁棒助听技术设计中的表现。

关键词

引用

@article{arxiv.2202.05756,
  title  = {A Novel Speech Intelligibility Enhancement Model based on CanonicalCorrelation and Deep Learning},
  author = {Tassadaq Hussain and Muhammad Diyan and Mandar Gogate and Kia Dashtipour and Ahsan Adeel and Yu Tsao and Amir Hussain},
  journal= {arXiv preprint arXiv:2202.05756},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2202.04172