面向 CNN 语音增强模型的自适应卷积
音频与语音处理
2025-11-11 v2 声音
摘要
深度学习语音增强方法显著改善了语音质量和可理解性。卷积神经网络 (CNN) 已被证明是许多高性能模型的关键组件。本文引入了自适应卷积,这是一种高效且通用的卷积模块,增强了模型对语音信号进行自适应表示的能力。自适应卷积执行帧级因果动态卷积,通过组装多个平行候选核为每个帧生成时变核。提出了一种轻量级注意力机制用于自适应卷积,利用当前和历史信息为每个候选核分配自适应权重。这使得卷积操作能够适应帧级语音谱特征,从而实现更高效的特征提取和重构。我们将自适应卷积分入各种 CNN-based 模型中,突出其通用性。实验结果表明,自适应卷积在计算复杂度几乎不增加的情况下显著提升了性能,尤其是针对轻量级模型。此外,我们提出了一种直观分析,揭示了核选择与信号特征之间的强相关性。进一步,我们提出了自适应卷积循环网络 (AdaptCRN),一种超轻量级模型,集成自适应卷积和高效编码器-解码器设计,实现了优于计算成本相同甚至更高的模型的优异性能。
引用
@article{arxiv.2502.14224,
title = {Adaptive Convolution for CNN-based Speech Enhancement Models},
author = {Dahan Wang and Xiaobin Rong and Shiruo Sun and Yuxiang Hu and Changbao Zhu and Jing Lu},
journal= {arXiv preprint arXiv:2502.14224},
year = {2025}
}
备注
Published in IEEE/ACM Transactions on Audio, Speech, and Language Processing