面向低延迟音频源分离的在线谱图反演
声音
2020-04-22 v3 音频与语音处理
摘要
音频源分离通常通过估计各源的短时傅里叶变换(STFT)幅度,再应用谱图反演算法恢复时域信号来实现。特别地,多输入谱图反演(MISI)算法已在近期若干工作中被成功利用。然而,该算法存在两个缺陷,本文对此予以解决。首先,它最初以启发式方式引入:我们在此提出一个严格的优化框架,从中导出 MISI,从而证明该算法的收敛性。此外,尽管 MISI 为离线操作,我们在此提出一种称为 oMISI 的 MISI 在线版本,适用于低延迟源分离,这是诸如助听器应用的重要需求。oMISI 还允许使用利用音频信号时间结构的替代相位初始化方案。在语音分离任务上的实验表明,oMISI 表现与其离线对应版本相当,从而展示了其在实时源分离中的潜力。
引用
@article{arxiv.1911.03128,
title = {Online Spectrogram Inversion for Low-Latency Audio Source Separation},
author = {Paul Magron and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1911.03128},
year = {2020}
}