中文

基于长帧与 STFT 幅值的高效 Transformer 语音增强

音频与语音处理 2023-06-06 v1 机器学习 声音

摘要

SepFormer 架构在语音分离中表现出非常好的效果。与其他学习型编码器模型一样,它使用短帧,因为已证明在这些情况下短帧能获得更好的性能。这导致输入处帧数众多,从而带来问题;由于 SepFormer 基于 transformer,其计算复杂度随序列变长而急剧增加。在本文中,我们将 SepFormer 用于语音增强任务,并表明通过用短时傅里叶变换(STFT)幅值表示替换学习型编码器特征,可以在不损害感知增强性能的前提下使用长帧。我们获得了同等的音质与可懂度评价指标,同时将 10 秒语音片段的操作数减少了约 8 倍。

关键词

引用

@article{arxiv.2206.11703,
  title  = {Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes},
  author = {Danilo de Oliveira and Tal Peer and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2206.11703},
  year   = {2023}
}

备注

Accepted at Interspeech 2022