与采样频率无关的对话分离
音频与语音处理
2022-06-07 v1 声音
摘要
在一些用于音频源分离的DNN中,相关模型参数与训练所用音频的采样频率无关。考虑到对话分离的应用,这一点在两种DNN架构上得到了验证:U-Net和全卷积模型。这些模型使用采样率为8 kHz的音频进行训练,学习到的参数被迁移到用于处理48 kHz音频的模型中。将分离出的音频源与用相同训练数据的48 kHz版本训练的同种模型架构所产生的音频源进行比较。听力测试和计算度量表明,用8 kHz或48 kHz训练的模型之间不存在显著的感知差异。这种学习参数的可迁移性使得训练更快且计算成本更低。它还使得能够使用采样频率低于当前应用所需频率的训练数据集,或使用具有多种采样频率的数据集合。
引用
@article{arxiv.2206.02124,
title = {Sampling Frequency Independent Dialogue Separation},
author = {Jouni Paulus and Matteo Torcoli},
journal= {arXiv preprint arXiv:2206.02124},
year = {2022}
}
备注
accepted into EUSIPCO 2022