FunASR:一个基础性的端到端语音识别工具包
声音
2023-05-19 v1 计算与语言
音频与语音处理
摘要
本文介绍 FunASR,一个旨在弥合学术研究与实际工业应用之间差距的开源语音识别工具包。FunASR 提供在大规模工业语料上训练的模型及其在应用中部署的能力。该工具包的旗舰模型 Paraformer 是一种非自回归端到端语音识别模型,其在一个包含 60000 小时语音的手动标注普通话语音识别数据集上完成训练。为提升 Paraformer 的性能,我们在标准 Paraformer 主干上增加了时间戳预测与热词定制能力。此外,为便于模型部署,我们开源了基于前馈时序记忆网络(FSMN-VAD)的语音活动检测模型,以及基于可控时延 Transformer(CT-Transformer)的文本后处理标点模型,二者均在工业语料上训练。这些功能模块为构建高精度长音频语音识别服务提供了坚实基础。相较于其他在开放数据集上训练的模型,Paraformer 展现出更优的性能。
引用
@article{arxiv.2305.11013,
title = {FunASR: A Fundamental End-to-End Speech Recognition Toolkit},
author = {Zhifu Gao and Zerui Li and Jiaming Wang and Haoneng Luo and Xian Shi and Mengzhe Chen and Yabin Li and Lingyun Zuo and Zhihao Du and Zhangyu Xiao and Shiliang Zhang},
journal= {arXiv preprint arXiv:2305.11013},
year = {2023}
}
备注
5 pages, 3 figures, accepted by INTERSPEECH 2023