用于准确且安全交易的数字微型模型
机器学习
2024-02-08 v1 计算与语言
声音
音频与语音处理
摘要
自动语音识别(ASR)系统在金融领域被用于通过实现自然语言理解和促进高效直观的交互来提升呼叫者体验。ASR 系统使用的日益增加要求此类系统表现出极低的错误率。收集数字数据的主流 ASR 模型是大型通用商业模型——Google Speech-to-text (STT) 或 Amazon Transcribe——或开源模型(OpenAI 的 Whisper)。此类 ASR 模型在数十万小时的音频数据上进行训练,需要大量资源才能运行。尽管大型语音识别模型最近取得了进展,我们仍强调了更小、专业化的“微型”模型的潜力。这种轻量级模型经过训练可以在数字识别特定任务上表现良好,与 Whisper 或 Google STT 等通用模型相竞争,同时使用不到 80 分钟的训练时间,并占用至少少一个数量级的内存资源。此外,与大型语音识别模型不同,微型模型在精心挑选和整理的数据集上进行训练,这使其具有高准确度、敏捷性且易于重新训练,同时消耗低计算资源。我们展示了在创建用于多位数字识别的微型模型方面的工作,这些模型能够处理反映真实世界发音模式的多种说话风格。我们的工作对特定领域的 ASR 模型、提高数字识别准确性和数据隐私做出了贡献。另一个优势是,其低资源消耗允许它们部署在本地,将私有数据保留在本地而不是上传到外部云。我们的结果表明,在识别数字方面,我们的微型模型比同类最佳的商业或开源 ASR 错误更少(我们最好的微型模型错误率为 1.8%,而 Whisper 的错误率为 5.8%),且内存占用低(我们的模型占用 0.66 GB VRAM,而 Whisper 占用 11 GB VRAM)。
引用
@article{arxiv.2402.01931,
title = {Digits micro-model for accurate and secure transactions},
author = {Chirag Chhablani and Nikhita Sharma and Jordan Hosier and Vijay K. Gurbani},
journal= {arXiv preprint arXiv:2402.01931},
year = {2024}
}
备注
7 pages, 1 figure, 5 tables