中文

利用大型预训练模型与贝叶斯推断推进音频情感与意图识别

音频与语音处理 2023-10-17 v1 声音

摘要

大型预训练模型在副语言系统中至关重要,在情感识别和口吃检测等任务中展现出有效性。在本文中,我们采用大型预训练模型参与 ACM 多媒体计算副语言学挑战赛,解决请求与情感共享任务。我们探索了利用音频与文本模态的纯音频与混合解决方案。我们的实证结果一致表明混合方法优于纯音频模型。此外,我们引入贝叶斯层作为标准线性输出层的替代方案。多模态融合方法在 HC-Requests 上达到 85.4% 的 UAR,在 HC-Complaints 上达到 60.2%。用于情感共享任务的集成模型取得了最佳的 rho 值 .614。本研究中探索的贝叶斯 wav2vec2 方法使我们能够轻松构建集成,代价仅需微调一个模型。此外,我们可以获得可用的置信度值,而非通常过度自信的后验概率。

关键词

引用

@article{arxiv.2310.10179,
  title  = {Advancing Audio Emotion and Intent Recognition with Large Pre-Trained Models and Bayesian Inference},
  author = {Dejan Porjazovski and Yaroslav Getman and Tamás Grósz and Mikko Kurimo},
  journal= {arXiv preprint arXiv:2310.10179},
  year   = {2023}
}

备注

Accepted at ACMM 2023