语义至关重要:面向情感分析的多模态特征
计算机视觉与模式识别
2025-04-21 v2 人工智能
计算与语言
摘要
本研究针对两项任务提出了我们的方法:情感模仿强度(Emotional Mimicry Intensity, EMI)估计挑战赛与行为矛盾/犹豫(Behavioural Ambivalence/Hesitancy, BAH)识别挑战赛,两项赛事均为第八届野外情感与行为分析研讨会暨竞赛的组成部分。我们利用在大规模播客数据集上预训练的 Wav2Vec 2.0 模型提取多种音频特征,以同时捕获语言与非语言信息。我们的方法融合了源自 Wav2Vec 2.0 的效价—唤醒度—支配度(VAD)模块、BERT 文本编码器以及视觉 Transformer(ViT),并通过长短期记忆(LSTM)架构或类卷积方法进行时序建模。我们将文本与视觉模态整合进分析中,认识到语义内容提供了有价值的上下文线索,并强调语音的意义往往比其声学特征本身传递更为关键的洞见。在某些情形下,融合视觉模态有助于更精确地解读文本模态。这种组合方法带来了显著的性能提升,在 EMI 任务上达到 ,在 BAH 任务上达到 ,分别获得 EMI 挑战赛第一名与 BAH 挑战赛第二名。
引用
@article{arxiv.2504.11460,
title = {Semantic Matters: Multimodal Features for Affective Analysis},
author = {Tobias Hallmen and Robin-Nico Kampa and Fabian Deuser and Norbert Oswald and Elisabeth André},
journal= {arXiv preprint arXiv:2504.11460},
year = {2025}
}