中文

深度学习在复杂语音声谱图中的综述

音频与语音处理 2025-10-06 v2 人工智能

摘要

最近的深度学习进展显著影响了语音信号处理领域,尤其是在复杂语谱图的分析与处理方面。本综述提供了关于利用深度神经网络处理复杂语谱图的最新技术的全面概述,而复杂语谱图包含了幅度和相位信息。我们首先介绍复杂语谱图及其用于 various 语音处理任务的相关特征。接下来,我们检查复杂值神经网络的关键组件和架构,这些网络专为处理复杂值数据而设计,已被应用于复杂语谱图的处理。由于最近的研究主要 focus于将实值神经网络应用于复杂语谱图,我们重新审视这些方法及其架构设计。然后,我们讨论各种针对训练神经网络以处理和建模复杂语谱图的训练策略和损失函数。本综述进一步检查了关键应用,包括相位检索、语音增强和说话人分离,其中深度学习通过利用复杂语谱图或其派生特征表示实现了显著进展。此外,我们检查了复杂语谱图与生成模型的交叉。本综述旨在为语音信号处理、深度学习及相关领域的研究者和实践者提供一个宝贵资源。

关键词

引用

@article{arxiv.2505.08694,
  title  = {A Survey of Deep Learning for Complex Speech Spectrograms},
  author = {Yuying Xie and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2505.08694},
  year   = {2025}
}