中文

Whispy:将 STT Whisper 模型适配到实时环境

声音 2024-05-07 v1 机器学习 音频与语音处理

摘要

大型通用变换模型最近在语音分析领域成为主流。具体而言,Whisper 在语音识别、翻译、语言识别和语音活动检测等相关任务中实现了领先成绩。然而,Whisper 模型并未针对实时条件进行设计,这一限制使其不适用于大量实际应用场景。本文介绍了 Whispy,一个旨在为 Whisper 预训练模型引入实时能力的系统。通过一系列架构优化,Whispy 能够消费实时音频流并生成高水平、连贯的语音转录,同时保持较低的计算成本。我们在大型公开语音数据集上评估了该系统,考察了 Whispy 引入的转录机制对 Whisper 输出的影响。实验结果表明,Whispy 在鲁棒性、响应速度和准确性方面均表现优异。

关键词

引用

@article{arxiv.2405.03484,
  title  = {Whispy: Adapting STT Whisper Models to Real-Time Environments},
  author = {Antonio Bevilacqua and Paolo Saviano and Alessandro Amirante and Simon Pietro Romano},
  journal= {arXiv preprint arXiv:2405.03484},
  year   = {2024}
}