中文

实时目标声音提取

声音 2023-04-20 v3 机器学习 音频与语音处理

摘要

我们提出了首个实现实时与流式目标声音提取的神经网络模型。为此,我们提出 Waveformer,一种编码器-解码器架构,其编码器为堆叠的扩张因果卷积层,解码器为 transformer 解码器层。该混合架构以计算高效的方式利用扩张因果卷积处理大感受野,同时借助基于 transformer 的架构的泛化性能。我们的评估显示,相较于该任务先前的模型,SI-SNRi 提升达 2.2–3.3 dB,同时模型尺寸减小 1.2–4 倍,运行时间降低 1.5–2 倍。我们提供代码、数据集与音频样本:https://waveformer.cs.washington.edu/。

关键词

引用

@article{arxiv.2211.02250,
  title  = {Real-Time Target Sound Extraction},
  author = {Bandhav Veluri and Justin Chan and Malek Itani and Tuochao Chen and Takuya Yoshioka and Shyamnath Gollakota},
  journal= {arXiv preprint arXiv:2211.02250},
  year   = {2023}
}

备注

ICASSP 2023 camera-ready