中文

超越声学情感识别:基于 LLM 的政治演讲多模态情感分析

人工智能 2026-05-22 v1 计算与语言 人机交互 声音 音频与语音处理

摘要

我们研究声学情感识别模型是否可作为政治演讲分析中 Pathos 维度的代理,正如由 TRUST 多智能体大型语言模型(LLM)管道所 operationalize 的那样。以德国联邦议会一次全体会议中 Felix Banaszak 的演讲(51 个片段,245 秒)为案例研究,我们比较了三种分析模态:(1) emotion2vec_plus_large,一种声学语音情感识别(SER)模型,其连续的 Arousal 和 Valence 值通过后验 Russell 圆周投影得出;(2) Gemini 2.5 Flash,一种分析完整演讲音频及其转录文本的 LLM,以开放式、上下文感知的方式进行分析;(3) 来自三个 advocacy LLM 监督者 ensemble 的 TRUST-Pathos 分数。斯皮尔曼等相关系数显示,Gemini Valence 与 TRUST-Pathos 相关性很强(rho = +0.664,p < 0.001),而 emotion2vec Valence 不相关(rho = +0.097,p = 0.499)。我们进一步通过对 Berlin 情感语音数据库(EMO-DB)的系统性质量评估表明,标准 SER 基准数据集受到演员化语音、文化偏见和类别不兼容性的影响。我们的结果表明,LLM 基于多模态分析在捕捉语义定义的政治情感方面优于声学模型alone,而声学特征仍对低层次 Arousal 估计有信息价值。未来工作将将方法扩展到视频分析,纳入面部表情和注视。

关键词

引用

@article{arxiv.2605.22732,
  title  = {Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models},
  author = {Juergen Dietrich},
  journal= {arXiv preprint arXiv:2605.22732},
  year   = {2026}
}

备注

13 pages, 1 figure