中文

基于冲突感知的多模态融合用于歧义与犹豫识别

计算机视觉与模式识别 2026-03-18 v1

摘要

歧义与犹豫 (A/H) 是一种微妙的情感状态,其中人通过不同通道显示出冲突信号——说了一件事,却让面部或语音告诉另一个故事。在临床环境中自动识别这些状态具有重要价值,但对于机器来说困难重重,因为关键证据存在于说了什么、听起来如何以及面部显示之间的 \emph{不一致} 之中。我们提出了 \textbf{ConflictAwareAH},一个为解决这一问题而构建的多模态框架。三个预训练的编码器提取视频、音频和文本表示。成对的冲突特征——即模态嵌入之间的元素级绝对差异——作为 \emph{双向} 线索:较大的跨模态差异标记A/H,而较小的差异确认行为一致性并锚定负类。这种冲突感知设计解决了文本主导方法的一个关键局限性,这些方法倾向于过度检测A/H (高F1-AH),而在确认其缺失方面则走弱路:我们的多模态模型在F1-NoAH上显著提高了4.6分,并将类别性能差距缩小一半。在来自ABAW10 Ambivalence/Hesitancy挑战赛的BAH数据集上,我们的方法在标记测试分割上达到 \textbf{0.694 的 Macro F1},并在私人排行榜上达到 \textbf{0.715},在单个GPU上训练时间不足25分钟,即超过了已发布的多模态基线10分以上。

关键词

引用

@article{arxiv.2603.15818,
  title  = {Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition},
  author = {Salah Eddine Bekhouche and Hichem Telli and Azeddine Benlamoudi and Salah Eddine Herrouz and Abdelmalik Taleb-Ahmed and Abdenour Hadid},
  journal= {arXiv preprint arXiv:2603.15818},
  year   = {2026}
}