中文

UX-NET:基于滤波与处理的改进 U-Net 用于实时时域音频分离

音频与语音处理 2022-10-31 v1 声音

摘要

本研究提出 UX-Net,一种基于改进 U-Net 架构的时域音频分离网络(TasNet)。所提 UX-Net 可实时工作,并处理单麦克风或多麦克风输入。受基于滤波与处理的人类听觉行为启发,该系统引入了新颖的混合与分离模块,从而以低代价和内存高效的方式建模语音源。混合模块在潜特征空间中组合编码输入,并输出所需数量的输出流。随后,在分离模块中应用改进的 U-Net(UX)块。UX 块首先以多种分辨率对编码输入进行滤波,继而聚合滤波信息并施加循环处理以估计分离源的掩码。UX-Net 中的字母“X”是 UX 块中所用循环层类型的名称占位符。在 WSJ0-2mix 基准数据集上的经验结果表明,某一 UX-Net 配置在使用仅 16% 的模型参数、减少 58% 计算量且保持低延迟的同时,比最先进的 Conv-TasNet 系统高出 0.85 dB SI-SNR。

关键词

引用

@article{arxiv.2210.15822,
  title  = {UX-NET: Filter-and-Process-based Improved U-Net for Real-time Time-domain Audio Separation},
  author = {Kashyap Patel and Anton Kovalyov and Issa Panahi},
  journal= {arXiv preprint arXiv:2210.15822},
  year   = {2022}
}

备注

Submitted to ICASSP 2023