音频源分离在抽样频率不匹配下的性能退化剖析
声音
2026-01-22 v1
摘要
基于深度神经网络的音频处理方法通常在单一抽样频率(SF)上进行训练。为处理未训练的抽样频率,常采用信号重抽样,但当输入抽样频率低于训练抽样频率时,可能导致性能下降。本文通过两个假设探讨此降级的原因:(i)通过上采样引入的高频分量不足,以及(ii)其存在的重要性大于其精确表征。为检验这些假设,我们将常规重抽样与三种替代方法进行比较:后置重抽样噪声添加(向重抽样信号添加高斯噪声)、噪声-内核重抽样(通过添加高斯噪声扰动内核以丰富高频分量)以及可训练-内核重抽样(通过训练适应插值内核)。在音乐源分离实验中,我们发现噪声-内核和可训练-内核重抽样缓解了常规重抽样下观察到的性能降级。我们进一步证明,噪声-内核重抽样在 diverse 模型中有效,突显其作为一种简单且实用选项。
引用
@article{arxiv.2601.14684,
title = {Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch},
author = {Kanami Imamura and Tomohiko Nakamura and Kohei Yatabe and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2601.14684},
year = {2026}
}
备注
Accepted for ICASSP 2026