中文

Whisper的k近邻搜索及其对说话人自适应的效果与影响

计算与语言 2025-02-12 v2 声音 音频与语音处理

摘要

语音识别性能因语言、领域和说话人特征(如口音)而异,但针对这些类别中的任何一类对模型进行微调都可能导致灾难性遗忘。标记级kk近邻搜索(kkNN)首先被提出用于自然语言生成(NLG)和机器翻译(MT)的神经序列解码器,它是一种非参数方法,通过在外部数据存储中进行推理时搜索来适应,而无需训练底层模型。我们表明,Transformer语音模型Whisper受益于kkNN。我们研究了语音和文本设置之间的差异。我们讨论了其对说话人自适应的意义,并分析了按性别、口音和年龄划分的改进情况。

关键词

引用

@article{arxiv.2410.18850,
  title  = {kNN For Whisper And Its Effect On Bias And Speaker Adaptation},
  author = {Maya K. Nachesa and Vlad Niculae},
  journal= {arXiv preprint arXiv:2410.18850},
  year   = {2025}
}

备注

Accepted to Findings of NAACL 2025. 7 pages incl. appendix, 2 figures, 6 tables