中文

语义至关重要:面向情感分析的多模态特征

计算机视觉与模式识别 2025-04-21 v2 人工智能 计算与语言

摘要

本研究针对两项任务提出了我们的方法:情感模仿强度(Emotional Mimicry Intensity, EMI)估计挑战赛与行为矛盾/犹豫(Behavioural Ambivalence/Hesitancy, BAH)识别挑战赛,两项赛事均为第八届野外情感与行为分析研讨会暨竞赛的组成部分。我们利用在大规模播客数据集上预训练的 Wav2Vec 2.0 模型提取多种音频特征,以同时捕获语言与非语言信息。我们的方法融合了源自 Wav2Vec 2.0 的效价—唤醒度—支配度(VAD)模块、BERT 文本编码器以及视觉 Transformer(ViT),并通过长短期记忆(LSTM)架构或类卷积方法进行时序建模。我们将文本与视觉模态整合进分析中,认识到语义内容提供了有价值的上下文线索,并强调语音的意义往往比其声学特征本身传递更为关键的洞见。在某些情形下,融合视觉模态有助于更精确地解读文本模态。这种组合方法带来了显著的性能提升,在 EMI 任务上达到 ρTEST=0.706\rho_{\text{TEST}} = 0.706,在 BAH 任务上达到 F1TEST=0.702F1_{\text{TEST}} = 0.702,分别获得 EMI 挑战赛第一名与 BAH 挑战赛第二名。

关键词

引用

@article{arxiv.2504.11460,
  title  = {Semantic Matters: Multimodal Features for Affective Analysis},
  author = {Tobias Hallmen and Robin-Nico Kampa and Fabian Deuser and Norbert Oswald and Elisabeth André},
  journal= {arXiv preprint arXiv:2504.11460},
  year   = {2025}
}