中文

单通道说话人计数监督学习中分类与回归的比较

音频与语音处理 2019-11-05 v2 声音

摘要

从单通道混合信号中估计并发说话人的最大数量的任务对于各种基于音频的应用十分重要,例如盲源分离、说话人日志、音频监控或听觉场景分类。基于强大的机器学习方法,我们开发了一个深度神经网络(DNN)来估计说话人计数。虽然 DNN 能高效地将输入表示映射到输出目标,但如何最佳处理网络输出来推断整数源计数估计仍不清楚,因为离散计数估计既可当作回归问题也可当作分类问题处理。本文研究这一重要设计决策,并解决如输入表示等互补参数选择问题。我们基于双向长短期记忆网络架构评估了一个最先进的 DNN 音频模型用于说话人计数估计。通过旨在确定该任务最佳整体策略的实验评估,给出了多达十个说话人混合中五秒语音段的结果。

关键词

引用

@article{arxiv.1712.04555,
  title  = {Classification vs. Regression in Supervised Learning for Single Channel Speaker Count Estimation},
  author = {Fabian-Robert Stöter and Soumitro Chakrabarty and Bernd Edler and Emanuël A. P. Habets},
  journal= {arXiv preprint arXiv:1712.04555},
  year   = {2019}
}

备注

Accepted in ICASSP 2018