中文

CLAIP-Emo:面向野外音视频情感识别的语言监督模型参数高效适配框架

多媒体 2025-09-19 v1 声音

摘要

音视频情感识别 (AVER) 在野外环境仍受姿态变形、遮挡以及背景噪声的限制。先前方法主要依赖大规模领域特定预训练,这既成本高昂又常与真实世界情感数据不匹配。为此,我们提出 CLAIP-Emo,一个模块化框架,将野外 AVER 重新诠释为语言监督基础模型 (CLIP/CLAP) 的参数高效适配。具体而言,该方法 (i) 通过冻结 CLIP/CLAP 主干网络,采用 LoRA 进行情感导向适配(更新 ≤4.0% 的总参数),(ii) 对音视频时序建模进行非对称分配,采用轻量级 Transformer 处理视觉动态,而对音频情绪采取均值池化,(iii) 应用简单的融合头进行预测。在 DFEW 和 MAFW 上,CLAIP-Emo (ViT-L/14) 实现了 80.14% 和 61.18% 的加权平均准确率,仅使用 8M 训练参数,达成新纪录。我们的发现表明,语言监督基础模型的参数高效适配为野外 AVER 提供了可扩展的替代方案,无需领域特定预训练。代码和模型将在 \href{https://github.com/MSA-LMC/CLAIP-Emo}{https://github.com/MSA-LMC/CLAIP-Emo} 提供。

关键词

引用

@article{arxiv.2509.14527,
  title  = {CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition},
  author = {Yin Chen and Jia Li and Jinpeng Hu and Zhenzhen Hu and Richang Hong},
  journal= {arXiv preprint arXiv:2509.14527},
  year   = {2025}
}

备注

The code and models will be available at https://github.com/MSA-LMC/CLAIP-Emo