面向空间中异步分布式设备的远场语音识别样本丢失检测
声音
2021-04-08 v1 音频与语音处理
摘要
在多麦克风多设备处理的许多应用中,不同输入通道间的同步会受到缺乏公共时钟和孤立样本丢失的影响。在本工作中,我们针对由空间中分布的一组麦克风所记录的会话语音场景中的样本丢失检测问题。目标是设计一个基于神经网络的模型,该模型在给定时域中的短窗口时,检测一个或多个设备是否经历了样本丢失事件。候选时间窗口从一组可能包含样本丢失的大时间区间中经预处理步骤选出。后者基于不同设备所获取信号间的归一化互相关应用。神经网络架构依赖于 CNN-LSTM 编码器,其后接多头注意力。实验使用人工和真实数据进行。我们提出的方法在从 CHiME-5 语料库提取的评估集上获得了 88% 的 F1 分数。在一组更大的多通道人工场景实验中发现了相当的性能。
引用
@article{arxiv.1911.06713,
title = {Sample Drop Detection for Distant-speech Recognition with Asynchronous Devices Distributed in Space},
author = {Tina Raissi and Santiago Pascual and Maurizio Omologo},
journal= {arXiv preprint arXiv:1911.06713},
year = {2021}
}
备注
Submitted to ICASSP 2020