大型语言模型与人类对情绪刺激的评分高度一致
人工智能
2025-08-21 v1
摘要
情绪在日常生活和高压力任务中对人类行为和认知产生巨大影响。关于是否或如何将大型语言模型 (LLM) 融入日常生活(例如,作为人类代理或与人类代理互动)的讨论,应基于对这些工具如何评估带有情绪负载的刺激或情境的理解。模型在这些情况下与人类行为的一致性,可以揭示 LLM 在特定角色或互动中的有效性。为了帮助建立这种理解,我们从多个流行的 LLM 中获取了对先前由人类进行过情绪内容评分的单词和图像数据集的评分。我们发现,在执行相同的评分任务时,GPT-4o 的反应与人类参与者跨模态、刺激和大多数评分量表都非常相似(在许多情况下 r = 0.9 或更高)。然而,人类和 LLM 评分者在唤醒度评分上的一致性较低,而愉悦度评分的一致性最高。总体而言,LLM 在五类别(愉悦、愤怒、悲伤、恐惧、厌恶)情绪框架内的对齐程度优于在二维(唤醒度和效价)组织内的对齐程度。最后,LLM 评分比人类评分更具同质性。这些结果共同开始描绘 LLM 代理如何解释情绪刺激,并突出了生物智能与人工智能在关键行为领域的相似性和差异。
引用
@article{arxiv.2508.14214,
title = {Large Language Models are Highly Aligned with Human Ratings of Emotional Stimuli},
author = {Mattson Ogg and Chace Ashcraft and Ritwik Bose and Raphael Norman-Tenazas and Michael Wolmetz},
journal= {arXiv preprint arXiv:2508.14214},
year = {2025}
}