中文

基于Whisper的表征在“真实环境”跨任务下游语音应用中的可迁移性

音频与语音处理 2023-05-25 v1 计算与语言 机器学习 声音

摘要

大型自监督预训练语音模型已在各类语音处理任务中取得显著成功。这些模型的自监督训练产生了可用于不同下游任务的通用语音表征,范围从自动语音识别(ASR)到说话人识别。近期,基于transformer的模型Whisper被提出,并在大量弱监督数据上训练用于ASR;其性能优于多个最先进的自监督模型。鉴于Whisper在ASR上的优越性,本文我们探索其表征在SUPERB基准中其他四个语音任务上的可迁移性。此外,我们探索Whisper表征在语音受环境噪声与房间混响污染的“真实环境”任务中的鲁棒性。实验结果表明,Whisper在各任务与环境条件下均取得有前景的结果,从而展现出跨任务真实世界部署的潜力。

关键词

引用

@article{arxiv.2305.14546,
  title  = {On the Transferability of Whisper-based Representations for "In-the-Wild" Cross-Task Downstream Speech Applications},
  author = {Vamsikrishna Chemudupati and Marzieh Tahaei and Heitor Guimaraes and Arthur Pimentel and Anderson Avila and Mehdi Rezagholizadeh and Boxing Chen and Tiago Falk},
  journal= {arXiv preprint arXiv:2305.14546},
  year   = {2023}
}