多模态大语言模型中的情感计算:当前证据与新兴方法学机遇
计算与语言
2026-04-07 v4
摘要
研究越来越多地利用音视频材料来分析政治传播中的情感。多模态大语言模型(mLLMs)有望通过情境学习实现此类分析。然而,我们缺乏对当前mLLMs在现实政治语境中可靠测量情感的系统证据。本文通过评估截至2026年初可用的开源和闭源mLLMs,针对基于视频的情感唤醒度测量,采用两种互补的人类标注数据集:实验室条件下的言语演员录音以及真实世界议会辩论录音。我发现存在显著的实验室与现场性能差距。在实验室条件下制造的视频中,所检验的mLLMs唤醒评分接近人类水平的可靠性。然而,在议会辩论录音中,所有检验的模型唤醒评分与人类平均评分之间的最高相关性仅为中等程度。此外,在每个数据集中,除一模型外,所有检验的mLLMs均表现出系统性的性别差异偏置, consistently 对男性演讲者的唤醒度估计低于女性演讲者,导致整体为正向强度偏置。这些发现揭示了当前mLLMs在现实世界政治视频分析中的重要局限,建立了追踪未来发展的严格评估框架。
引用
@article{arxiv.2512.10882,
title = {Computational emotion analysis with multimodal LLMs: Current evidence on an emerging methodological opportunity},
author = {Hauke Licht},
journal= {arXiv preprint arXiv:2512.10882},
year = {2026}
}