与采样频率无关的通用声音分离
音频与语音处理
2023-09-25 v1 机器学习
声音
摘要
本文提出一种能够处理未训练采样频率(SF)的通用声音分离(USS)方法。USS 旨在分离不同类型的任意声源,并且可作为实现通用声源分离器的重要技术,该分离器能作为任何下游任务的预处理器而被普遍使用。为实现通用声源分离器,有两个基本属性:关于声源类型和记录条件的通用性。前一属性已在 USS 文献中被研究,其极大增加了单个神经网络可处理的声源类型数量。然而,后一属性(例如 SF)尽管必要,却较少受到关注。由于 SF 因下游任务不同而变化很大,通用声源分离器必须处理多种多样的 SF。本文为兼顾两种属性,提出了一种计算高效的 USS 网络 SuDoRM-RF 的与采样频率无关(SFI)扩展。所提网络使用我们之前提出的 SFI 卷积层,其通过依据输入 SF 生成卷积核来处理各种 SF。实验表明,信号重采样会降低 USS 性能,且所提方法相比基于信号重采样的方法在各种 SF 下表现更为稳定。
引用
@article{arxiv.2309.12581,
title = {Sampling-Frequency-Independent Universal Sound Separation},
author = {Tomohiko Nakamura and Kohei Yatabe},
journal= {arXiv preprint arXiv:2309.12581},
year = {2023}
}
备注
Submitted to ICASSP2024