通过 Prompt-Tuning 与分词技术提升 Indian 语言 Whisper 的准确率与速度
计算与语言
2024-12-30 v1 音频与语音处理
摘要
自动语音识别领域近期因大型基础模型如 Whisper 而取得了显著进展。然而,这些模型在低资源语言(如印度语言)上常常难以取得良好性能。本文探索了两种新方法来提升 Whisper 在印度语言方言中的多语言语音识别性能。第一,我们提出了利用语言族信息进行 prompt-tuning,以提升在语言上相似的语言上的准确率。第二,我们引入一种新型分词器,可减少生成标记的数量,从而加快 Whisper 的推理速度。我们的广泛实验表明,分词器显著降低了推理时间,而 prompt-tuning 在各种 Whisper 模型规模(包括 Small、Medium 和 Large)上均提升了准确率。这些技术共同实现了最佳 WER 与推理速度之间的平衡。
关键词
引用
@article{arxiv.2412.19785,
title = {Enhancing Whisper's Accuracy and Speed for Indian Languages through Prompt-Tuning and Tokenization},
author = {Kumud Tripathi and Raj Gothi and Pankaj Wasnik},
journal= {arXiv preprint arXiv:2412.19785},
year = {2024}
}
备注
Accepted at ICASSP 2025, 5 pages, 1 figures, 5 tables