中文

计算机听觉的音频增强——基于样本重要性的迭代训练范式

声音 2024-08-13 v1 人工智能 音频与语音处理

摘要

神经网络模型用于音频任务(如自动语音识别ASR和声学场景分类ASC)易受噪声干扰。为改善音频质量,常在目标音频应用前端显式使用增强模块。本文提出一种端到端学习解决方案,联合优化音频增强(AE)模块及后续应用。为引导AE模块针对目标应用优化,尤其克服困难样本,我们利用样本级性能测度作为样本重要性指示。实验中,我们考虑四种代表性应用进行评估,即ASR、语音命令识别(SCR)、语音情感识别(SER)和ASC。这些应用涉及语音和非语音任务,涉及语义和非语义特征、瞬态和全局信息。实验结果表明,我们提出的方法可显著提升模型在日常噪声环境下的鲁棒性,尤其在低信噪比(SNR)条件下,对广泛的计算机听觉任务效果显著。

关键词

引用

@article{arxiv.2408.06264,
  title  = {Audio Enhancement for Computer Audition -- An Iterative Training Paradigm Using Sample Importance},
  author = {Manuel Milling and Shuo Liu and Andreas Triantafyllopoulos and Ilhan Aslan and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2408.06264},
  year   = {2024}
}