用于说话人计数多通道CRNN:性能分析
声音
2021-01-07 v1 音频与语音处理
摘要
说话人计数是指估计音频录音中同时说话的人数。对于说话人日记化、分离、定位与跟踪等多个音频处理任务,知晓每一时间步的说话人数量是前提条件,或至少是一大优势,此外还能实现低延迟处理。在先前工作中,我们用多通道卷积循环神经网络解决了说话人计数问题,该网络以短期帧分辨率给出估计。本工作中,我们表明对于给定的帧,在输入序列中存在一个最优位置可获得最佳预测精度。我们通过实验证明了该最优位置、输入序列长度与卷积滤波器尺寸之间的关联。
引用
@article{arxiv.2101.01977,
title = {Multichannel CRNN for Speaker Counting: an Analysis of Performance},
author = {Pierre-Amaury Grumiaux and Srdan Kitic and Laurent Girin and Alexandre Guérin},
journal= {arXiv preprint arXiv:2101.01977},
year = {2021}
}
备注
Presented at Forum Acusticum 2020