中文

基于Dirichlet参数化的不确定性感知多模态情感识别

人工智能 2026-02-11 v1

摘要

本文提出了一个轻量级且面向边缘设备部署的多模态情感识别(MER)框架。为展示框架的多功能性,我们的实现使用三个模态——语音、文本和面部图像。然而,该系统是完全模块化的,可以扩展以支持其他模态或任务。每个模态都通过一个为推断效率优化而设计的专用 backbone 处理:Emotion2Vec 用于语音,基于ResNet的模型用于面部表情,DistilRoBERTa 用于文本。为了整合跨模态的不确定性,我们引入一种基于Dempster-Shafr理论和Dirichlet证据的模型-和任务无关的融合机制。该方法直接在模型 logits 上操作,捕捉预测不确定性,而无需额外训练或联合分布估计,使其在情感识别之外也具备广泛适用性。对五个基准数据集(eNTERFACE05、MEAD、MELD、RAVDESS和CREMA-D)的验证显示,我们的方法在保持竞争性精度的同时,具有计算效率和对模糊或缺失输入的鲁棒性。总体而言,提出的框架强调模块化、可扩展性和现实可行性,为医疗保健、人机交互以及其他情感感知应用铺平了道路。

关键词

引用

@article{arxiv.2602.09121,
  title  = {Uncertainty-Aware Multimodal Emotion Recognition through Dirichlet Parameterization},
  author = {Rémi Grzeczkowicz and Eric Soriano and Ali Janati and Miyu Zhang and Gerard Comas-Quiles and Victor Carballo Araruna and Aneesh Jonelagadda},
  journal= {arXiv preprint arXiv:2602.09121},
  year   = {2026}
}

备注

8 pages, 3 figures