通过提示微调扩展Whisper以实现目标说话人自动语音识别
计算与语言
2024-01-12 v2 声音
音频与语音处理
摘要
目标说话人自动语音识别(TS-ASR)旨在从多说话人重叠语音中转录出目标说话人的所需语音。现有的大多数目标说话人ASR方法要么需要从头训练,要么需要对预训练模型进行全量微调,这导致显著的训练成本,且不适用于大型基础模型。本工作利用提示微调这一参数高效的微调方法,将大规模单说话人ASR模型Whisper扩展至TS-ASR。我们探索并优化了多种提示微调变体及其配置,以用于TS-ASR。实验结果表明,提示微调能够达到与最先进的全量训练方法相当的性能,同时仅需约1%的任务特定模型参数。值得注意的是,Whisper的原始特性,如反向文本正则化和时间戳标记,在目标说话人ASR中得以保留,使得生成的转录文本保持自然且信息丰富。
引用
@article{arxiv.2312.08079,
title = {Extending Whisper with prompt tuning to target-speaker ASR},
author = {Hao Ma and Zhiyuan Peng and Mingjie Shao and Jing Li and Ju Liu},
journal= {arXiv preprint arXiv:2312.08079},
year = {2024}
}
备注
ICASSP 2024