中文

面向情绪识别的通用音视频学习

机器学习 2026-01-13 v2 多媒体 声音 音频与语音处理

摘要

当前多数音视频情绪识别模型缺乏实际部署所需的灵活性。我们设想一种多模态系统,即便仅单一模态可用也能工作,并可互换地用于预测情绪属性或识别类别化情绪。在多模态情绪识别系统中实现此类灵活性十分困难,原因在于准确解释与融合异构数据源的固有挑战。在允许回归与分类任务直接切换的同时稳健处理缺失或部分信息亦具挑战。本研究提出一种通用音视频学习(VAVL)框架,用于处理情绪回归或情绪分类任务中的单模态与多模态系统。我们实现的音视频框架即便在部分训练集缺乏音视频配对数据(即仅音频或仅视频)时也可训练。我们通过音视频共享层、共享层上的残差连接以及单模态重建任务实现了有效的表示学习。实验结果显示,我们的架构在 CREMA-D、MSP-IMPROV 与 CMU-MOSEI 语料库上显著优于强基线。值得注意的是,VAVL 在 MSP-IMPROV 语料库的情绪属性预测任务上取得了新的最优性能。

关键词

引用

@article{arxiv.2305.07216,
  title  = {Versatile audio-visual learning for emotion recognition},
  author = {Lucas Goncalves and Seong-Gyun Leem and Wei-Cheng Lin and Berrak Sisman and Carlos Busso},
  journal= {arXiv preprint arXiv:2305.07216},
  year   = {2026}
}

备注

18 pages, 4 Figures, 3 tables (published at IEEE Transactions on Affective Computing)