中文

用于说话人计数多通道CRNN:性能分析

声音 2021-01-07 v1 音频与语音处理

摘要

说话人计数是指估计音频录音中同时说话的人数。对于说话人日记化、分离、定位与跟踪等多个音频处理任务,知晓每一时间步的说话人数量是前提条件,或至少是一大优势,此外还能实现低延迟处理。在先前工作中,我们用多通道卷积循环神经网络解决了说话人计数问题,该网络以短期帧分辨率给出估计。本工作中,我们表明对于给定的帧,在输入序列中存在一个最优位置可获得最佳预测精度。我们通过实验证明了该最优位置、输入序列长度与卷积滤波器尺寸之间的关联。

关键词

引用

@article{arxiv.2101.01977,
  title  = {Multichannel CRNN for Speaker Counting: an Analysis of Performance},
  author = {Pierre-Amaury Grumiaux and Srdan Kitic and Laurent Girin and Alexandre Guérin},
  journal= {arXiv preprint arXiv:2101.01977},
  year   = {2021}
}

备注

Presented at Forum Acusticum 2020