中文

通过提示微调扩展Whisper以实现目标说话人自动语音识别

计算与语言 2024-01-12 v2 声音 音频与语音处理

摘要

目标说话人自动语音识别(TS-ASR)旨在从多说话人重叠语音中转录出目标说话人的所需语音。现有的大多数目标说话人ASR方法要么需要从头训练,要么需要对预训练模型进行全量微调,这导致显著的训练成本,且不适用于大型基础模型。本工作利用提示微调这一参数高效的微调方法,将大规模单说话人ASR模型Whisper扩展至TS-ASR。我们探索并优化了多种提示微调变体及其配置,以用于TS-ASR。实验结果表明,提示微调能够达到与最先进的全量训练方法相当的性能,同时仅需约1%的任务特定模型参数。值得注意的是,Whisper的原始特性,如反向文本正则化和时间戳标记,在目标说话人ASR中得以保留,使得生成的转录文本保持自然且信息丰富。

关键词

引用

@article{arxiv.2312.08079,
  title  = {Extending Whisper with prompt tuning to target-speaker ASR},
  author = {Hao Ma and Zhiyuan Peng and Mingjie Shao and Jing Li and Ju Liu},
  journal= {arXiv preprint arXiv:2312.08079},
  year   = {2024}
}

备注

ICASSP 2024