8th Affective Behavior Analysis in-the-Wild Competition EMI Challenge 的技术方法
计算机视觉与模式识别
2025-03-26 v3 人工智能
摘要
情感模仿强度 (EMI) 估计在理解人类社会行为和推进人机交互中起着关键作用。核心挑战在于动态关联建模和对多模态时序信号的鲁健融合。为解决现有方法的局限性——对跨模态协同作用的利用不足、对噪声敏感、以及受限的细粒度对齐能力——本文提出了双阶段跨模态对齐框架。阶段 1 基于 CLIP 架构开发了 vision-text 和 audio-text 对比学习网络,通过模态解耦的预训练实现特征空间的初步对齐。阶段 2 引入时序感知的动态融合模块,将 Temporal Convolutional Networks (TCN) 和 gated 双向 LSTM 集成,以分别捕获面部表情的宏观演化模式和语音特征的局部动态。新颖的质量导向融合策略进一步实现了在遮挡和噪声下的模态补偿的可微分权重分配。在 Hume-Vidmimic2 数据集上进行的实验表明,该方法在 validate 集合上的六个情感维度上平均 Pearson 相关系数可达 0.51。值得注意的是,在 test 集合上实现了 0.68 的成绩,斩获了 8th ABAW (Affective Behavior Analysis in the Wild) 比赛中 EMI 挑战赛的亚军,为在野外环境中进行细粒度情感分析提供了新路径。
引用
@article{arxiv.2503.10603,
title = {Technical Approach for the EMI Challenge in the 8th Affective Behavior Analysis in-the-Wild Competition},
author = {Jun Yu and Lingsi Zhu and Yanjun Chi and Yunxiang Zhang and Yang Zheng and Yongqi Wang and Xilong Lu},
journal= {arXiv preprint arXiv:2503.10603},
year = {2025}
}