Team LEYA在第十届ABAW竞赛中的多模态含糊/犹豫识别方法
计算机视觉与模式识别
2026-03-16 v1 人工智能
摘要
在无约束视频中进行含糊/犹豫状态的识别是一个具有挑战性的问题,由于这种行为状态的细微性、多模态性和情境依赖性。本文为第十届ABAW竞赛提出了一种用于视频级别含糊/犹豫识别的多模态方法。该方法整合了四种互补模态:场景、面部、音频和文本。基于VideoMAE的模型捕获场景动态,通过统计池化聚合情感帧级嵌入来编码面部信息,使用EmotionWav2Vec2.0提取声学表示,并通过基于Mamba的时序编码器进行处理;语言线索则使用微调的基于transformer的文本模型进行建模。最终的单模态嵌入通过包括原型增强变体的多模态融合模型进行进一步组合。在BAH语料库上的实验表明,多模态融合相对于所有单模态基线都有显著提升。最佳单模态配置实现了70.02%的平均MF1分数,而最佳多模态融合模型达到83.25%。最高的最终测试性能71.43%由五个原型增强融合模型的集成获得。所得结果突显了互补多模态线索和稳健融合策略在含糊/犹豫识别中的重要性。
引用
@article{arxiv.2603.12848,
title = {Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach},
author = {Elena Ryumina and Alexandr Axyonov and Dmitry Sysoev and Timur Abdulkadirov and Kirill Almetov and Yulia Morozova and Dmitry Ryumin},
journal= {arXiv preprint arXiv:2603.12848},
year = {2026}
}
备注
8 pages, 2 figures