中文

面向法庭命令式语音识别的可扩展离线 ASR 框架

音频与语音处理 2025-09-16 v1 计算与语言 声音

摘要

我们提出了一个开源框架,用于命令式语音识别,旨在弥合资源密集型在线系统与高延迟批处理之间的鸿沟。我们的做法利用语音活动检测 (VAD) 对音频进行分段,然后通过 Whisper 模型并行转录这些片段,以实现高效的音频复用。与 SuperWhisper 等专有系统不同,本框架兼容大多数 ASR 架构,包括广泛使用的 CTC 基于模型。我们的复用技术在实际场景中最大化了计算资源利用率,已部署于印度约 15% 的法庭。在实数据上的评估显示,随着用户并发度增加,与顺序批处理相比,延迟 consistently 降低。现场演示将展示我们的开源实现,允许观众实时互动。

关键词

引用

@article{arxiv.2507.01021,
  title  = {Scalable Offline ASR for Command-Style Dictation in Courtrooms},
  author = {Kumarmanas Nethil and Vaibhav Mishra and Kriti Anandan and Kavya Manohar},
  journal= {arXiv preprint arXiv:2507.01021},
  year   = {2025}
}

备注

Accepted to Interspeech 2025 Show & Tell