中文

消除基于分类的声源定位中的量化误差

音频与语音处理 2024-01-30 v2

摘要

声源定位(SSL)涉及估计声源的方向角(DOA)。由于DOA估计的输出空间是连续的,回归可能更适合DOA,提供更高的精度。然而在实践中,分类通常优于回归,对干扰表现出更强的鲁棒性。反之,分类的缺点是固有的量化误差。在分类范式内,DOA输出空间被离散化为区间,每个区间被视为一个类别。这些类别表现出强烈的类间相关性,具有内在有序性,且区间越接近相似度越高。然而这一点尚未被充分利用。为此,我们提出无偏标签分布(ULD)以消除训练目标中的量化误差。此外,我们为软标签族定制了两个损失函数:负对数绝对误差(NLAE)和无需激活的均方误差(MSE(wo))。最后,我们引入加权相邻解码(WAD)以克服模型预测解码过程中的量化误差。实验结果表明,我们的方法超越了分类量化极限,取得了最先进的性能。我们的代码和补充材料可在 https://github.com/linfeng-feng/ULD 获取。

关键词

引用

@article{arxiv.2311.12305,
  title  = {Eliminating Quantization Errors in Classification-Based Sound Source Localization},
  author = {Linfeng Feng and Xiao-Lei Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2311.12305},
  year   = {2024}
}

备注

12 pages