实时语音频带宽扩展
音频与语音处理
2021-02-10 v2 声音
摘要
在本文中,我们提出一种轻量级模型用于语音信号的频带宽扩展,将采样频率从8kHz提升至16kHz,同时将高频内容恢复到几乎与16kHz真实值难以区分的水平。该模型架构基于SEANet(Sound EnhAncement Network,一种波到波的完全卷积模型),其利用特征损失与对抗损失的组合来重建输入语音的增强版本。此外,我们提出一种可在设备上以流式模式部署的SEANet变体,实现了16ms的架构延迟。在移动CPU单核上测评时,处理一帧16ms数据仅需1.5ms。低延迟使其可用于双向语音通信系统。
引用
@article{arxiv.2010.10677,
title = {Real-time Speech Frequency Bandwidth Extension},
author = {Yunpeng Li and Marco Tagliasacchi and Oleg Rybakov and Victor Ungureanu and Dominik Roblek},
journal= {arXiv preprint arXiv:2010.10677},
year = {2021}
}