存在活跃前景语音情况下的鲁棒声学场景分类
音频与语音处理
2021-08-03 v1 声音
摘要
我们提出了一种基于 iVector 的声学场景分类(ASC)系统,适用于可能存在活跃前景语音的真实环境。在所提出的系统中,每段录音由一个固定长度的 iVector 表示,该向量对录音的重要属性进行建模。我们使用具有类特定协方差模型的正则化高斯后端分类器,从这些 iVector 中提取相关的声学场景信息。为缓解前景说话人主导所捕获信号时造成的严重性能下降,我们研究了在由噪声功率谱密度估计导出的梅尔频率倒谱系数(MFCCs)上应用 iVector 框架。该噪声底可以通过统计方式从单通道录音中提取。我们表明,噪声底特征与多条件训练互补,在多条件训练中将前景语音添加到训练信号中以减小训练与测试条件之间的失配。在 DCASE 2016 Task 1 数据集上的实验结果表明,在最不利条件下,基于噪声底的特征和多条件训练实现了超过 25 个百分点(绝对)的显著分类准确率提升。这些有前景的结果可进一步促进 ASC 在如可听戴设备这类资源受限设备中的集成。
引用
@article{arxiv.2108.00912,
title = {Robust Acoustic Scene Classification in the Presence of Active Foreground Speech},
author = {Siyuan Song and Brecht Desplanques and Celest De Moor and Kris Demuynck and Nilesh Madhu},
journal= {arXiv preprint arXiv:2108.00912},
year = {2021}
}