中文

DasFormer:用于多通道/单通道语音分离的深度交替谱图Transformer

声音 2023-03-15 v2 多媒体 音频与语音处理

摘要

对于语音分离任务,以往研究通常将多通道与单通道场景视为两条研究路线并分别开发专门方案。相反,我们提出一种简单统一的架构——DasFormer(深度交替谱图Transformer)——以在具挑战性的混响环境中处理二者。不同于逐帧序列建模,谱图中的每个时频单元(TF-bin)被赋予一个编码频谱与空间信息的嵌入向量。基于此输入,DasFormer由多个简单块的重复构成,每个块集成:1)两个多头自注意力(MHSA)模块交替处理谱图中各频率单元与时间帧;2)每个MHSA前的MBConv用于建模谱图上的局部特征。实验表明,DasFormer具有强大的时频表示建模能力,其性能远超当前多通道语音分离的SOTA模型,并在更具挑战性但更真实的混响场景中达到单通道SOTA。

关键词

引用

@article{arxiv.2302.10657,
  title  = {DasFormer: Deep Alternating Spectrogram Transformer for Multi/Single-Channel Speech Separation},
  author = {Shuo Wang and Xiangyu Kong and Xiulian Peng and Mahmood Movassagh and Vinod Prakash and Yan Lu},
  journal= {arXiv preprint arXiv:2302.10657},
  year   = {2023}
}

备注

5 pages, accepted by ICASSP2023