中文

面向波形生成的复杂值神经网络

声音 2026-03-13 v1 人工智能

摘要

神经声码器最近取得了波形生成的进展,产生自然且富有表现力的音频。其中,基于iSTFT的声码器最近受到关注。它们预测复杂值频谱图,然后通过iSTFT合成波形,从而避免可能增加计算成本的学习式上采样阶段。然而,当前方法使用实值网络处理实部和虚部,独立处理,这限制了其捕捉复杂频谱图内在结构的能力。我们提出ComVo,一种采用原生复数算术的复杂值神经声码器,其生成器和判别器均使用复数算术。这使得对抗训练框架能够提供复数表示中的结构化反馈。为以结构化方式引导相位变换,我们引入相位量化,该量化离散化相位值并正则化训练过程。最后,我们提出一种块矩阵计算方案,通过减少冗余操作来提高训练效率。实验表明,ComVo在与相当实值基线相比的合成质量方面取得了更好的效果,其块矩阵方案将训练时间缩短25%。音频样本和代码均可在 https://hs-oh-prml.github.io/ComVo/ 获取。

关键词

引用

@article{arxiv.2603.11589,
  title  = {Toward Complex-Valued Neural Networks for Waveform Generation},
  author = {Hyung-Seok Oh and Deok-Hyeon Cho and Seung-Bin Kim and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2603.11589},
  year   = {2026}
}

备注

ICLR 2026 (accepted)