基于卷积神经网络的超声无声语音接口语音活动检测
声音
2021-09-21 v3 音频与语音处理
摘要
当输入音频信号含噪时,语音活动检测(VAD)并非易事,而当输入甚至不是音频记录时则更为复杂。无声语音接口(SSI)即属此情形:我们记录发音器官在说话时的运动,并旨在根据该记录重建语音信号。我们的 SSI 系统由舌部运动的超声视频合成语音,所得语音信号的质量通过诸如底层神经网络的均方误差损失函数以及重建语音相对于原始的梅尔倒谱失真(MCD)等指标评估。在此,我们首先证明训练数据中静音的量可同时影响 MCD 评估指标与神经网络模型的性能。随后,我们训练一个卷积神经网络分类器以分离无声与含语音的超声舌图像,并使用常规 VAD 算法从相应语音信号生成训练标签。实验中,我们基于超声的语音/静音分离器达到了约 85% 的分类准确率与约 86% 的 AUC 分数。
引用
@article{arxiv.2105.13718,
title = {Voice Activity Detection for Ultrasound-based Silent Speech Interfaces using Convolutional Neural Networks},
author = {Amin Honarmandi Shandiz and László Tóth},
journal= {arXiv preprint arXiv:2105.13718},
year = {2021}
}
备注
12 pages, 7 tables, 4 figures