CNN自注意力语音活动检测器
声音
2022-03-08 v1 音频与语音处理
摘要
在本工作中,我们提出一种新颖的单通道语音活动检测器(VAD)方法。我们利用卷积神经网络(CNN)挖掘含噪输入频谱的空间信息以提取逐帧嵌入序列,随后采用自注意力(SA)编码器从嵌入序列中发掘上下文信息。不同于以往在每帧(含上下文帧)上分别处理的工作,我们的方法能够一次性处理整段信号,从而具备长感受野。我们表明,CNN与SA架构的融合优于仅基于CNN或仅基于SA的方法。大量实验研究表明,我们的模型在真实场景基准上优于先前模型,并以相对较小且轻量的模型取得了当前最优(SOTA)结果。
引用
@article{arxiv.2203.02944,
title = {CNN self-attention voice activity detector},
author = {Amit Sofer and Shlomo E. Chazan},
journal= {arXiv preprint arXiv:2203.02944},
year = {2022}
}