基于Dirichlet参数化的不确定性感知多模态情感识别
人工智能
2026-02-11 v1
摘要
本文提出了一个轻量级且面向边缘设备部署的多模态情感识别(MER)框架。为展示框架的多功能性,我们的实现使用三个模态——语音、文本和面部图像。然而,该系统是完全模块化的,可以扩展以支持其他模态或任务。每个模态都通过一个为推断效率优化而设计的专用 backbone 处理:Emotion2Vec 用于语音,基于ResNet的模型用于面部表情,DistilRoBERTa 用于文本。为了整合跨模态的不确定性,我们引入一种基于Dempster-Shafr理论和Dirichlet证据的模型-和任务无关的融合机制。该方法直接在模型 logits 上操作,捕捉预测不确定性,而无需额外训练或联合分布估计,使其在情感识别之外也具备广泛适用性。对五个基准数据集(eNTERFACE05、MEAD、MELD、RAVDESS和CREMA-D)的验证显示,我们的方法在保持竞争性精度的同时,具有计算效率和对模糊或缺失输入的鲁棒性。总体而言,提出的框架强调模块化、可扩展性和现实可行性,为医疗保健、人机交互以及其他情感感知应用铺平了道路。
引用
@article{arxiv.2602.09121,
title = {Uncertainty-Aware Multimodal Emotion Recognition through Dirichlet Parameterization},
author = {Rémi Grzeczkowicz and Eric Soriano and Ali Janati and Miyu Zhang and Gerard Comas-Quiles and Victor Carballo Araruna and Aneesh Jonelagadda},
journal= {arXiv preprint arXiv:2602.09121},
year = {2026}
}
备注
8 pages, 3 figures