Canary-1B-v2 与 Parakeet-TDT-0.6B-v3:面向多语言语音识别与语音翻译的高效高性能模型
计算与语言
2025-09-26 v2 音频与语音处理
摘要
本报告介绍了Canary-1B-v2,这是一个快速、稳健的多语言自动语音识别(ASR)和语音到文本翻译(AST)模型。采用FastConformer编码器和Transformer解码器构建,支持主要为欧洲语言的25种语言。该模型在170万小时的总数据样本上进行训练,包括Granary和NeMo ASR Set 3.0,同时加入非语音音频以减少ASR和AST的幻觉现象。我们描述了其两阶段的预训练和微调过程,采用动态数据平衡策略,以及使用nGPT编码器的实验。结果表明,nGPT在海量数据下表现良好,而FastConformer在微调后表现更佳。对于时间戳,Canary-1B-v2采用NeMo Forced Aligner(NFA)配合辅助CTC模型,为ASR和AST提供可靠的分段级时间戳。评估结果显示,Canary-1B-v2在英文ASR上超越Whisper-large-v3,同时快10倍;在多语言ASR和AST方面,性能与更大规模的模型如Seamless-M4T-v2-large和基于LLM的系统相当。我们还发布了Parakeet-TDT-0.6B-v3,这是v2的后继版本,仅需6亿参数即可实现相同25种语言的多语言ASR。
引用
@article{arxiv.2509.14128,
title = {Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST},
author = {Monica Sekoyan and Nithin Rao Koluguri and Nune Tadevosyan and Piotr Zelasko and Travis Bartley and Nikolay Karpov and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2509.14128},
year = {2025}
}
备注
Mini Version of it Submitted to ICASSP 2026