适配OpenAI的Whisper用于SEAME与ASRU2019码切换中英混合语音识别数据集
音频与语音处理
2023-11-30 v1
摘要
本文详述了将OpenAI的Whisper模型适配于SEAME与ASRU2019语料上的码切换中英混合语音识别(ASR)的实验结果。我们进行了两项实验:a) 使用 1 至 100/200 小时的适配数据以展示适配有效性;b) 考察Whisper提示中不同的语言ID设置。混合错误率结果显示,为在性能增益上达到饱和,所需适配数据量可低至 小时(SEAME),而ASRU任务在更多适配数据(100 小时)下仍持续展现性能提升。对于语言提示,结果显示尽管不同提示策略初始产生不同结果,使用码切换数据适配Whisper模型均能一致地改善其性能。这些结果在将Whisper应用于新目标域适配的相关任务时,也可能对社区有所裨益。
引用
@article{arxiv.2311.17382,
title = {Adapting OpenAI's Whisper for Speech Recognition on Code-Switch Mandarin-English SEAME and ASRU2019 Datasets},
author = {Yuhang Yang and Yizhou Peng and Xionghu Zhong and Hao Huang and Eng Siong Chng},
journal= {arXiv preprint arXiv:2311.17382},
year = {2023}
}
备注
6 pages, 3 figures, 4 tables