中文

基于贝叶斯神经网络的语音唤醒识别端到端标签不确定性建模

音频与语音处理 2022-06-28 v4 机器学习 声音

摘要

情绪是主观构念。近期的端到端语音情绪识别系统尽管具备最先进的性能,通常却对情绪的主观本质不加区分。在本工作中,我们引入一种端到端贝叶斯神经网络架构,以捕获情绪表达中唤醒维度的内在主观性。据我们所知,本工作是首个将贝叶斯神经网络用于语音情绪识别的研究。在训练时,网络学习权重的分布以捕获与主观唤醒标注相关的内在不确定性。为此,我们引入一项损失项,使模型能显式地在标注分布上训练,而非仅在均值或金标准标签上训练。我们在 AVEC'16 数据集上评估所提方法。对结果的定性与定量分析表明,所提模型能恰当捕获主观唤醒标注的分布,在不确定建模的均值与标准差估计上取得最先进结果。

关键词

引用

@article{arxiv.2110.03299,
  title  = {End-To-End Label Uncertainty Modeling for Speech-based Arousal Recognition Using Bayesian Neural Networks},
  author = {Navin Raj Prabhu and Guillaume Carbajal and Nale Lehmann-Willenbrock and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2110.03299},
  year   = {2022}
}

备注

ACCEPTED to INTERSPEECH 2022