中文

封闭空间中基于单通道音频的说话人距离估计

音频与语音处理 2024-03-27 v1 声音

摘要

基于音频的距离估计在声学场景分析、声源定位和房间建模等多种应用中起着关键作用。大多数研究主要集中于采用分类方法,将距离离散化为不同类别,从而实现更平滑的模型训练并获得更高准确率,但这限制了所获声源位置的精度。针对这一方向,本文提出了一种使用带有注意力模块的卷积循环神经网络从音频信号进行连续距离估计的新方法。注意力机制使模型能够聚焦于相关的时间和频谱特征,增强其捕捉细粒度距离相关信息的能力。为评估所提方法的有效性,我们在具有三个真实度级别(合成房间脉冲响应、测量响应与卷积语音、真实录音)的受控环境中,使用四个数据集(我们的合成数据集、QMULTIMIT、VoiceHome-2 和 STARSS23)进行了广泛实验。实验结果表明,该模型在无噪声合成场景下实现了 0.11 米的绝对误差。此外,在混合场景下,绝对误差约为 1.30 米。在不可预测的环境因素和噪声普遍存在的真实场景中,算法性能的绝对误差约为 0.50 米。为便于研究复现,我们在 https://github.com/michaelneri/audio-distance-estimation 上提供了模型、代码和合成数据集。

关键词

引用

@article{arxiv.2403.17514,
  title  = {Speaker Distance Estimation in Enclosures from Single-Channel Audio},
  author = {Michael Neri and Archontis Politis and Daniel Krause and Marco Carli and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2403.17514},
  year   = {2024}
}

备注

Accepted for publication in IEEE/ACM Transactions on Audio, Speech, and Language Processing