MaskSR: 用于全频带语音恢复的掩码语言模型
声音
2024-06-05 v1 人工智能
机器学习
音频与语音处理
信号处理
摘要
语音恢复旨在存在多种失真的情况下恢复高质量语音。尽管已有多种深度学习范式被研究用于此任务,但新兴语言模型的能力尚未得到充分探索。本文提出MaskSR,一种掩码语言模型,能够联合考虑噪声、混响、削波和低带宽,恢复全频带44.1 kHz语音。MaskSR使用预训练神经编解码器提取的离散声学标记。训练时,MaskSR被优化以预测从高质量目标语音中提取的随机掩码标记,并以具有各种失真的受损语音为条件。推理时,MaskSR通过高效的迭代采样重建目标语音标记。大量实验表明,与多种模型相比,MaskSR在全频带语音恢复任务及其子任务上均取得了有竞争力的结果。
引用
@article{arxiv.2406.02092,
title = {MaskSR: Masked Language Model for Full-band Speech Restoration},
author = {Xu Li and Qirui Wang and Xiaoyu Liu},
journal= {arXiv preprint arXiv:2406.02092},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024. Demo page: https://masksr.github.io/MaskSR/