中文

联合说话人日志与识别的机器学习不确定性量化

音频与语音处理 2024-01-02 v2 声音

摘要

本文研究了联合说话人日志与识别 (JSID) 中的调制谱特征 (Φ\Phi) 和梅尔频率倒谱系数 (Ψ\Psi)。JSID 非常重要,因为仅靠说话人日志来区分说话人对于许多应用来说是不够的,通常还需要识别说话人。使用基于 Φ\Phi 的卷积神经网络 (CNN) 和基于 Ψ\Psi 的长短期记忆网络 (LSTM) 建立机器学习模型,然后拼接至全连接层。实验 1 表明,同时基于 Φ\PhiΨ\Psi 的模型比仅基于其中之一的模型具有更好的日志错误率 (DER);基于 Φ\Phi 的 CNN 的 DER 为 29.09%,而基于 Ψ\Psi 的 LSTM 为 27.78%,同时基于两者的模型为 19.44%。实验 1 还调查了偶然不确定性,结果表明同时基于 Φ\PhiΨ\Psi 的模型在正确预测时的平均熵为 0.927 bits(满 4 bits),相比之下错误预测时为 1.896 bits,这与熵直方图的形状一起表明,该模型有助于指示其不确定的位置。实验 2 使用蒙特卡洛 dropout (MCD) 调查了认知不确定性以及偶然不确定性。它比较了同时基于 Φ\PhiΨ\Psi 的模型与在 x-vectors (XX) 上训练的模型,随后对认知不确定性应用卡尔曼滤波平滑以进行重分割和模型集成。尽管基于 XX 的两个模型(DER 分别为 10.23% 和 9.74%)在各自进行卡尔曼滤波平滑后优于基于 Φ\PhiΨ\Psi 的模型(DER 为 17.85%),但使用卡尔曼滤波平滑方法将它们结合可将 DER 提升至 9.29%。错误预测的偶然不确定性更高。两个实验均表明,基于 Φ\Phi 的模型在区分重叠说话人方面不如预期。然而,实验 2 表明模型集成在处理重叠说话人方面比单个模型做得更好。

关键词

引用

@article{arxiv.2312.16763,
  title  = {Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification},
  author = {Simon W. McKnight and Aidan O. T. Hogg and Vincent W. Neo and Patrick A. Naylor},
  journal= {arXiv preprint arXiv:2312.16763},
  year   = {2024}
}

备注

12 pages, 7 figures