Miipher:一种融合自监督语音与文本表示的鲁棒语音修复模型
声音
2023-08-15 v2 机器学习
音频与语音处理
摘要
语音修复(SR)是将退化语音信号转换为高质量语音的任务。在本研究中,我们提出一种称为 Miipher 的鲁棒 SR 模型,并将 Miipher 应用于一个新的 SR 场景:通过将从 Web 收集的语音样本转换为录音室质量,来增加语音生成的高质量训练数据量。为使我们的 SR 模型对各种退化具有鲁棒性,我们使用(i)从 w2v-BERT 提取的语音表示作为输入特征,以及(ii)通过 PnG-BERT 从转写文本提取的文本表示作为语言条件特征。实验表明,Miipher(i)对各种音频退化具有鲁棒性,且(ii)使我们能够从 Web 上收集的恢复语音样本训练高质量的文本到语音(TTS)模型。音频样本可在我们的演示页查看:google.github.io/df-conformer/miipher/
引用
@article{arxiv.2303.01664,
title = {Miipher: A Robust Speech Restoration Model Integrating Self-Supervised Speech and Text Representations},
author = {Yuma Koizumi and Heiga Zen and Shigeki Karita and Yifan Ding and Kohei Yatabe and Nobuyuki Morioka and Yu Zhang and Wei Han and Ankur Bapna and Michiel Bacchiani},
journal= {arXiv preprint arXiv:2303.01664},
year = {2023}
}
备注
Accepted to WASPAA 2023