基于序列建模的输入自适应谱特征压缩用于声源分离
音频与语音处理
2026-02-10 v1
摘要
时频域双路径模型在声源分离中表现出强大的性能且广泛应用。由于其计算成本随频率箱的数量而增长,这些模型常在高采样率任务中(如音乐声源分离和电影音频声源分离)使用带划分(BS)模块。BS编码器通过为每个预定义子带编码特征来压缩频率信息。它通过引入归纳偏置来强调低频部分,从而实现有效压缩。尽管成功,但BS模块存在两个固有局限性:(i)它不具备输入自适应性,无法利用输入相关信息;(ii)参数数量大,因为每个子带都需要一个专用模块。为此,我们提出谱特征压缩(SFC)。SFC使用单个序列建模模块进行输入压缩,使其既具有输入自适应性又是参数高效。我们研究了两种SFC变体,一种基于交叉注意力,另一种基于Mamba,并引入受BS模块启发的归纳偏置,使其适用于频率信息压缩。实验在音乐声源分离和电影音频声源分离任务上表明,SFC模块在不同的分离器大小和压缩比下均优于BS模块。我们还提供分析表明,SFC能够适应性地从输入中捕获频率模式。
引用
@article{arxiv.2602.08671,
title = {Input-Adaptive Spectral Feature Compression by Sequence Modeling for Source Separation},
author = {Kohei Saijo and Yoshiaki Bando},
journal= {arXiv preprint arXiv:2602.08671},
year = {2026}
}
备注
Accepted by IEEE TASLP. \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses