中文

情感模仿强度预测的两阶段多模态框架

计算机视觉与模式识别 2026-05-22 v1 人工智能 人机交互

摘要

我们提交了 Hume-ABAW10 情感模仿强度 (EMI) 挑战的作品,该挑战旨在从野生多模态视频片段中预测六个连续情感强度维度:钦佩、愉悦、决心、共情痛苦、兴奋和喜悦。我们提出了一个分阶段的多模态框架,结合文本、声学和视觉表示, optionally 包含运动分支。我们的方法首先独立训练各模态的编码器,然后通过轻量级回归器融合其学习到的表示,采用模态 dropout 和受控编码器适应。我们提交的系统中,最佳验证性能通过 text-audio-vision-motion 混合模型在扩张的 4:1 分割下获得,实现了 0.4722 的平均皮尔逊相关系数。虽然运动分支仅带来极小的提升,但其行为仍具有研究兴趣。我们的团队在 EMI 挑战中获得第三名,测试集平均皮尔逊相关系数达到 0.57。总体而言,我们提供了一个实用且可复现的 EMI 预测基线。

关键词

引用

@article{arxiv.2605.21869,
  title  = {Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction},
  author = {Dinithi Dissanayake and Shaveen Silva and Ovindu Atukorala and Prasanth Sasikumar and Suranga Nanayakkara},
  journal= {arXiv preprint arXiv:2605.21869},
  year   = {2026}
}

备注

10th Affective & Behavior Analysis in-the-wild, CVPR Workshop 2026