基于改进模型结构的多任务学习推进 VAD 系统
声音
2023-12-25 v1 音频与语音处理
摘要
在语音识别系统中,语音活动检测 (VAD) 是一个关键的前端模块。针对基于 DFSMN 的传统二值 VAD 系统噪声鲁棒性差的问题,本文进一步提出了基于多任务学习和改进模型的语义 VAD,以满足实时和离线系统的特定应用需求。在内部数据集上的评估显示,与基于 DFSMN 的实时 VAD 系统相比,基于 RWKV 的实时语义 VAD 系统在字符错误率 (CER) 上相对降低了 7.0%,检测代价函数 (DCF) 相对降低了 26.1%,噪声鲁棒性比率 (NRR) 相对提高了 19.2%。同样,与基于 DFSMN 的离线 VAD 系统相比,基于 SAN-M 的离线 VAD 系统在 CER 上相对降低了 4.4%,DCF 相对降低了 18.6%,NRR 相对提高了 3.5%。
引用
@article{arxiv.2312.14860,
title = {Advancing VAD Systems Based on Multi-Task Learning with Improved Model Structures},
author = {Lingyun Zuo and Keyu An and Shiliang Zhang and Zhijie Yan},
journal= {arXiv preprint arXiv:2312.14860},
year = {2023}
}