EICAP:通过多轮对话深度评估与增强大语言模型的情商
计算与语言
2025-08-11 v1 人机交互
摘要
情商(EI)是开发与人类对齐的大语言模型(LLM)中一个关键但尚未充分探索的维度。为填补这一空白,我们引入了一个统一的、基于心理学的、专为大语言模型(LLM)量身定制的四层情商分类法,包括情感追踪、原因推断、评估和情感上适当的回应生成。在此框架基础上,我们提出了EICAP-Bench,一个新颖的多项选择题(MCQ)风格的多轮基准,旨在评估开源LLM在不同语言和文化背景下的情商能力。我们在EmoCap-Bench上评估了六个LLM:LLaMA3 (8B)、LLaMA3-Instruct、Gemma (9B)、Gemma-Instruct、Qwen2.5 (7B)和Qwen2.5-Instruct,确定Qwen2.5-Instruct为最强基线。为了评估增强情商能力的潜力,我们使用LoRA适配器在UltraChat(UC)——一个大规模、指令微调的对话数据集上,对Qwen2.5-Base和Qwen2.5-Instruct进行英语和阿拉伯语的微调。我们的统计分析显示,在五个情感层中,只有情感识别层通过基于UC的微调显示出显著改善。这些发现突显了现有预训练和指令微调范式在赋予LLM更深层次情感推理方面的局限性,并强调了需要针对性的数据和建模策略来实现全面的情感对齐。
引用
@article{arxiv.2508.06196,
title = {EICAP: Deep Dive in Assessment and Enhancement of Large Language Models in Emotional Intelligence through Multi-Turn Conversations},
author = {Nizi Nazar and Ehsaneddin Asgari},
journal= {arXiv preprint arXiv:2508.06196},
year = {2025}
}