中文

ClearerVoice-Studio:连接高级语音处理研究与实际部署

声音 2025-06-25 v1 音频与语音处理

摘要

本文介绍了 ClearerVoice-Studio,这是一个开源的人工智能驱动的语音处理工具包,旨在连接前沿研究与实际应用。不同于 SpeechBrain 和 ESPnet 等宽泛平台,ClearerVoice-Studio 专注于语音增强、分离、超分辨率和多模态目标说话人提取等相互关联的语音任务。其关键优势在于提供的先进预训练模型,包括 FRCRN(300 万次使用)和 MossFormer(250 万次使用),针对实际场景进行了优化。该工具还提供模型优化工具、多格式音频支持、SpeechScore 评估工具包以及用户友好的界面,服务于研究人员、开发者和最终用户。其快速采纳带来了 3000 个 GitHub星标和 239 个 fork,凸显了其在学术和工业界的影响。本文详细介绍了 ClearerVoice-Studio 的功能、架构、训练策略、基准测试、社区影响及未来计划。源码地址为 https://github.com/modelscope/ClearerVoice-Studio。

关键词

引用

@article{arxiv.2506.19398,
  title  = {ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment},
  author = {Shengkui Zhao and Zexu Pan and Bin Ma},
  journal= {arXiv preprint arXiv:2506.19398},
  year   = {2025}
}

备注

accepted by Interspeech 2025, 5 pages, 5 tables