中文

人类与多模态大语言模型(MLLM)由视频片段触发的高维情感结构之间的对应性

人工智能 2025-05-26 v2

摘要

近期研究表明,人类情感具有高维复杂结构。若要充分捕捉这种复杂性,需采用新的方法,因为忽略高维度的传统模型风险会遗漏人类情感的关键细微差别。本研究检验了最新一代快速演化的多模态大语言模型(MLLM)是否捕捉到这些高维复杂情感结构,包括其能力与局限。具体而言,我们将参与者观看视频后自报的情感评分与模型生成的估计(如 Gemini 或 GPT)进行比较。我们不仅在单个视频层面评估性能,还从考虑视频间关系的情感结构层面进行评估。在情感结构简单相关性层面,结果显示人类与模型推断情感结构之间存在强烈相似性。为进一步探讨人类与模型的相似性是来自单个人物层面还是粗糙范畴层面,我们应用了戈尔巴克斯坦最优传输方法。我们发现尽管在严格的单项目水平上性能并非最佳,但在引发相似情感的视频范畴之间表现相当,表明该模型能够在范畴层面推断人类情感体验。我们的结果表明,当前的最先进 MLLM 在捕捉复杂高维情感结构的范畴层面以及其在单项目层面准确捕捉整个结构的明显局限方面具有广泛的能力。

关键词

引用

@article{arxiv.2505.12746,
  title  = {Correspondence of high-dimensional emotion structures elicited by video clips between humans and Multimodal LLMs},
  author = {Haruka Asanuma and Naoko Koide-Majima and Ken Nakamura and Takato Horii and Shinji Nishimoto and Masafumi Oizumi},
  journal= {arXiv preprint arXiv:2505.12746},
  year   = {2025}
}

备注

25 pages, 7 figures