中文

基于发散度的多模态融合方法:解决第十届ABAWR挑战赛中的A/H视频识别问题

计算机视觉与模式识别 2026-03-19 v1

摘要

我们针对第十届ABAWR挑战赛(CVPR 2026)中的A/H视频识别挑战提出了方法。我们提出了一种基于发散度的多模态融合方法,显式测量视觉、音频和文本通道之间的跨模态冲突。通过Py-Feat提取动作单元(AUs),通过 Wav2Vec 2.0 提取音频特征,通过 BERT 提取文本特征。每个模态通过带注意力池化的BiLSTM处理,并投射到共享嵌入空间。融合模块计算模态嵌入之间的两两绝对差,直接捕捉构成A/H的不一致性。在BAH数据集上,我们的方法在验证测试集上实现了0.6808的宏平均F1分数,显著优于挑战基线的0.2827。统计分析确认,在1,132个视频中,AUs的时间变动性是判别A/H的主要视觉特征。

关键词

引用

@article{arxiv.2603.16939,
  title  = {Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion},
  author = {Aislan Gabriel O. Souza and Agostinho Freire and Leandro Honorato Silva and Igor Lucas B. da Silva and João Vinícius R. de Andrade and Gabriel C. de Albuquerque and Lucas Matheus da S. Oliveira and Mário Stela Guerra and Luciana Machado},
  journal= {arXiv preprint arXiv:2603.16939},
  year   = {2026}
}