中文

少即是多:无需大规模数据的精准语音识别与翻译

计算与语言 2024-07-01 v1 机器学习 声音 音频与语音处理

摘要

近期的语音识别和翻译进展依赖数十万小时的互联网语音数据。我们认为,不必依赖 web 规模数据即可达到当前的最高准确率。Canary - 多语言语音识别和语音翻译模型,在英语、法语、西班牙语和德语语言上超过当前最先进的模型 - Whisper、OWSM 和 Seamless-M4T,同时训练的数据量是这些模型的一个数量级。三大关键因素使模型实现数据高效:(1)基于 FastConformer 的注意力 encoder-decoder 架构(2)使用机器翻译生成合成数据进行训练(3)先进的训练技术:数据平衡、动态数据混合、动态分箱和噪声鲁棒微调。该模型、模型权重和训练代码将开源发布。

关键词

引用

@article{arxiv.2406.19674,
  title  = {Less is More: Accurate Speech Recognition & Translation without Web-Scale Data},
  author = {Krishna C. Puvvada and Piotr Żelasko and He Huang and Oleksii Hrinchuk and Nithin Rao Koluguri and Kunal Dhawan and Somshubra Majumdar and Elena Rastorgueva and Zhehuai Chen and Vitaly Lavrukhin and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2406.19674},
  year   = {2024}
}

备注

Accepted at Interspeech-2024