面向法庭命令式语音识别的可扩展离线 ASR 框架
音频与语音处理
2025-09-16 v1 计算与语言
声音
摘要
我们提出了一个开源框架,用于命令式语音识别,旨在弥合资源密集型在线系统与高延迟批处理之间的鸿沟。我们的做法利用语音活动检测 (VAD) 对音频进行分段,然后通过 Whisper 模型并行转录这些片段,以实现高效的音频复用。与 SuperWhisper 等专有系统不同,本框架兼容大多数 ASR 架构,包括广泛使用的 CTC 基于模型。我们的复用技术在实际场景中最大化了计算资源利用率,已部署于印度约 15% 的法庭。在实数据上的评估显示,随着用户并发度增加,与顺序批处理相比,延迟 consistently 降低。现场演示将展示我们的开源实现,允许观众实时互动。
引用
@article{arxiv.2507.01021,
title = {Scalable Offline ASR for Command-Style Dictation in Courtrooms},
author = {Kumarmanas Nethil and Vaibhav Mishra and Kriti Anandan and Kavya Manohar},
journal= {arXiv preprint arXiv:2507.01021},
year = {2025}
}
备注
Accepted to Interspeech 2025 Show & Tell