中文

零样情境下的Whisper稀有词识别提升

音频与语音处理 2025-02-19 v2 声音

摘要

尽管Whisper在68万小时的网络规模音频数据上进行训练,但在识别稀有词(如特定领域术语)方面仍面临困难,解决方案是通过提示进行情境偏置。为改进该方法,本文提出一种监督式学习策略,用于微调Whisper以实现情境偏置指令。我们表明,仅使用670小时的Common Voice英文数据集进行微调,即可使模型在11个多样化的开源英文数据集上实现稳健的泛化,稀有词识别率提升45.6%,未见词识别率提升60.8%。令人惊讶的是,模型的情境偏置能力甚至能泛化到微调期间未见过的语言。

关键词

引用

@article{arxiv.2502.11572,
  title  = {Improving Rare-Word Recognition of Whisper in Zero-Shot Settings},
  author = {Yash Jogi and Vaibhav Aggarwal and Shabari S Nair and Yash Verma and Aayush Kubba},
  journal= {arXiv preprint arXiv:2502.11572},
  year   = {2025}
}

备注

Accepted at IEEE SLT 2024