Convoifilter:一种鸡尾酒会语音识别的案例研究
声音
2024-04-09 v3 计算与语言
音频与语音处理
摘要
本文提出一种端到端模型,旨在改善拥挤嘈杂环境中针对特定说话人的自动语音识别(ASR)。该模型利用单通道语音增强模块将说话人语音从背景噪声中分离(ConVoiFilter)以及一个 ASR 模块。通过该方式,模型可将 ASR 的词错误率(WER)从 80% 降至 26.4%。通常,由于数据需求不同,这两个组件被独立调整。然而,语音增强可能产生降低 ASR 效率的异常。通过实施联合微调策略,模型可将 WER 从独立调优时的 26.4% 降至联合调优时的 14.5%。我们公开了预训练模型以促进进一步研究 hf.co/nguyenvulebinh/voice-filter。
引用
@article{arxiv.2308.11380,
title = {Convoifilter: A case study of doing cocktail party speech recognition},
author = {Thai-Binh Nguyen and Alexander Waibel},
journal= {arXiv preprint arXiv:2308.11380},
year = {2024}
}
备注
Accepted at HSCMA 2024