大语言模型的情商
人工智能
2023-07-31 v2
摘要
大语言模型(LLMs)在众多学科中展现出非凡能力,主要通过语言生成、知识运用和复杂推理等任务进行评估。然而,它们与人类情感和价值的对齐——这对现实应用至关重要——尚未被系统评估。在此,我们评估了 LLMs 的情商(EI),涵盖情感识别、阐释与理解,这些是有效沟通与社会交互所必需的。具体而言,我们首先开发了一种新颖的聚焦于情感理解(EU)(EI 的核心组成部分)的心理测量评估,适用于人类与 LLMs。该测试要求在现实场景中评估复杂情感(例如,尽管感觉表现不佳,John 却意外取得最高分,表现出惊讶、喜悦、困惑、骄傲)。以超过 500 名成年人构建的参照框架,我们测试了多种主流 LLMs。大多数取得了高于平均水平的 EQ 分数,其中 GPT-4 以 117 的 EQ 超过了 89% 的人类参与者。有趣的是,多元模式分析揭示部分 LLMs 显然未依赖类人机制来达到人类水平表现,因其表征模式在性质上不同于人类。此外,我们讨论了模型规模、训练方法与架构等因素对 LLMs 的 EQ 的影响。总之,我们的研究呈现了首批针对 LLMs 类人特征的心理学测量评估之一,或可启发旨在兼具高智力与情商未来 LLMs 的发展。项目网站:https://emotional-intelligence.github.io/
引用
@article{arxiv.2307.09042,
title = {Emotional Intelligence of Large Language Models},
author = {Xuena Wang and Xueting Li and Zi Yin and Yue Wu and Liu Jia},
journal= {arXiv preprint arXiv:2307.09042},
year = {2023}
}
备注
36 pages, 5 figures