实时目标声音提取
声音
2023-04-20 v3 机器学习
音频与语音处理
摘要
我们提出了首个实现实时与流式目标声音提取的神经网络模型。为此,我们提出 Waveformer,一种编码器-解码器架构,其编码器为堆叠的扩张因果卷积层,解码器为 transformer 解码器层。该混合架构以计算高效的方式利用扩张因果卷积处理大感受野,同时借助基于 transformer 的架构的泛化性能。我们的评估显示,相较于该任务先前的模型,SI-SNRi 提升达 2.2–3.3 dB,同时模型尺寸减小 1.2–4 倍,运行时间降低 1.5–2 倍。我们提供代码、数据集与音频样本:https://waveformer.cs.washington.edu/。
引用
@article{arxiv.2211.02250,
title = {Real-Time Target Sound Extraction},
author = {Bandhav Veluri and Justin Chan and Malek Itani and Tuochao Chen and Takuya Yoshioka and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2211.02250},
year = {2023}
}
备注
ICASSP 2023 camera-ready