中文

面向音频信号应用的相位感知深度学习——复杂值 CNN

机器学习 2025-10-14 v1 人工智能 声音

摘要

本研究探讨了复杂值卷积神经网络(CVCNN)在音频信号处理中的设计与应用,重点关注保持和利用通常被忽略的相位信息。我们首先呈现 CVCNN 的基础理论概念,包括复杂卷积、池化层、Wirtinger 微分以及各种复杂值激活函数。这些概念配以关键训练技术适配,包括复杂批归一化和权重初始化方案,以确保训练动力学稳定。经验评估分为三个阶段:第一阶段在标准图像数据集上对 CVCNN 进行基准测试,表现与实值 CNN 相当,即使在合成复杂扰动下也如此。虽然我们的关注点是音频信号处理,但我们首先在图像数据集上评估 CVCNN 以建立基准性能并验证训练稳定性,再将其应用于音频任务。在第二个实验中,我们聚焦于使用梅尔频率cepstral 系数(MFCC)进行音频分类。CVCNN 在真值 MFCC 上略胜于实值 CNN,而在保留相位的输入工作流程中则显示了在无结构修改的情况下利用相位的挑战。第三个实验引入 GNN 通过边权重建模相位信息,其中加入相位后在二分类和多分类音乐流派分类中均取得可衡量的提升。这些结果凸显了复杂值结构的表达能力,并确认相位作为音频处理应用中有意义且可利用的特征。尽管当前方法有前景,尤其是以 cardioid 等激活函数为佳,但未来在相位感知设计方面的进步将是释放复杂表示在神经网络中潜力的关键。

关键词

引用

@article{arxiv.2510.09926,
  title  = {Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications},
  author = {Naman Agrawal},
  journal= {arXiv preprint arXiv:2510.09926},
  year   = {2025}
}