低延迟时域多通道语音与音乐源分离
音频与语音处理
2022-04-13 v1 声音
摘要
目标是获得一种具有极低延迟的简易多通道源分离。应用可包括电话会议、助听器、增强现实或选择性主动噪声消除。这些实时应用需要极低延迟,通常小于约6 ms,且低复杂度,因为它们通常在小型便携设备上运行。为此我们不需要最佳分离,而是“有用”的分离,且不仅限于语音,还包括音乐与噪声。常见的频域方法具有更高延迟与复杂度。因此我们引入一种称为“随机方向”的新颖概率优化方法,其可克服局部极小,应用于简单时域解混结构,且可扩展以实现低复杂度。随后在分离语音与音乐源以及使用3D麦克风设置方面,将其与频域方法进行比较。
引用
@article{arxiv.2204.05609,
title = {Low Latency Time Domain Multichannel Speech and Music Source Separation},
author = {Gerald Schuller},
journal= {arXiv preprint arXiv:2204.05609},
year = {2022}
}
备注
This paper was published at the Asilomar Conference on Signals, Systems, and Computers in November 2021. A software repository for the paper is: https://github.com/TUIlmenauAMS/LowDelayMultichannelSourceSeparation_Random-Directions_Demo