中文

Convoifilter:一种鸡尾酒会语音识别的案例研究

声音 2024-04-09 v3 计算与语言 音频与语音处理

摘要

本文提出一种端到端模型,旨在改善拥挤嘈杂环境中针对特定说话人的自动语音识别(ASR)。该模型利用单通道语音增强模块将说话人语音从背景噪声中分离(ConVoiFilter)以及一个 ASR 模块。通过该方式,模型可将 ASR 的词错误率(WER)从 80% 降至 26.4%。通常,由于数据需求不同,这两个组件被独立调整。然而,语音增强可能产生降低 ASR 效率的异常。通过实施联合微调策略,模型可将 WER 从独立调优时的 26.4% 降至联合调优时的 14.5%。我们公开了预训练模型以促进进一步研究 hf.co/nguyenvulebinh/voice-filter。

关键词

引用

@article{arxiv.2308.11380,
  title  = {Convoifilter: A case study of doing cocktail party speech recognition},
  author = {Thai-Binh Nguyen and Alexander Waibel},
  journal= {arXiv preprint arXiv:2308.11380},
  year   = {2024}
}

备注

Accepted at HSCMA 2024