RespVAD:基于视频提取呼吸模式的语音活动检测
机器学习
2020-08-24 v1 图像与视频处理
机器学习
摘要
语音活动检测(VAD)是指在音频和视频等数字信号中识别人声语音区域任务。尽管 VAD 是许多语音处理系统的必要第一步,但在音频录制存在高水平环境噪声时面临挑战。为提升此类条件下的 VAD 性能,已有若干利用从说话人视频录制中嘴部/唇部周围区域提取视觉信息的方法被提出。尽管这些方法相较纯音频方法具有优势,但它们依赖于嘴部/唇部区域的准确提取。受此启发,本文提出一种基于呼吸构成语音产生主要能量来源这一事实的 VAD 新范式。具体而言,开发了一种利用从说话人视频中提取的呼吸模式的音频无关 VAD 技术。首先使用基于光流的方法从聚焦说话人胸腹区域的视频中提取呼吸模式。随后,利用神经序列到序列预测模型从呼吸模式信号中检测语音活动。所提方法的有效性通过在真实声学环境下记录的高难度数据集上的实验得到验证,并与四种基于音频和视觉线索的先前方法进行了比较。
引用
@article{arxiv.2008.09466,
title = {RespVAD: Voice Activity Detection via Video-Extracted Respiration Patterns},
author = {Arnab Kumar Mondal and Prathosh A. P},
journal= {arXiv preprint arXiv:2008.09466},
year = {2020}
}
备注
Accepted in IEEE Sensor Letters