基于注意力引导卷积神经网络的鸡尾酒会场景实时说话人计数
音频与语音处理
2021-11-02 v1 机器学习
声音
摘要
当前大多数语音技术系统被设计为即便在存在多个活跃说话人时也能良好运行。然而,多数解决方案假设同现说话人的数量是已知的。遗憾的是,该信息在真实应用中未必总可获得。在本研究中,我们提出一种实时的单通道注意力引导卷积神经网络(CNN)来估计重叠语音中活跃说话人的数量。所提系统利用 CNN 模型从语音频谱内容中提取高层信息。接着,注意力机制将所提取信息汇总为一个紧凑特征向量而不丢失关键信息。最后,使用全连接网络对活跃说话人进行分类。在基于 WSJ 语料库的模拟重叠语音上的实验表明,相较于常规时间平均池化,注意力方案将性能绝对提升了近 3%。所提注意力引导 CNN 在短至 20 帧(即 200 ms)的语音段上取得了 76.15% 的加权准确率与平均召回率,以及 75.80% 的精确率。在输入信号长于 100 帧(即 1s)的离线场景中,注意力引导模型的所有分类指标均超过 92%。
引用
@article{arxiv.2111.00316,
title = {Real-time Speaker counting in a cocktail party scenario using Attention-guided Convolutional Neural Network},
author = {Midia Yousefi and John H. L. Hansen},
journal= {arXiv preprint arXiv:2111.00316},
year = {2021}
}