基于长帧与 STFT 幅值的高效 Transformer 语音增强
音频与语音处理
2023-06-06 v1 机器学习
声音
摘要
SepFormer 架构在语音分离中表现出非常好的效果。与其他学习型编码器模型一样,它使用短帧,因为已证明在这些情况下短帧能获得更好的性能。这导致输入处帧数众多,从而带来问题;由于 SepFormer 基于 transformer,其计算复杂度随序列变长而急剧增加。在本文中,我们将 SepFormer 用于语音增强任务,并表明通过用短时傅里叶变换(STFT)幅值表示替换学习型编码器特征,可以在不损害感知增强性能的前提下使用长帧。我们获得了同等的音质与可懂度评价指标,同时将 10 秒语音片段的操作数减少了约 8 倍。
引用
@article{arxiv.2206.11703,
title = {Efficient Transformer-based Speech Enhancement Using Long Frames and STFT Magnitudes},
author = {Danilo de Oliveira and Tal Peer and Timo Gerkmann},
journal= {arXiv preprint arXiv:2206.11703},
year = {2023}
}
备注
Accepted at Interspeech 2022