中文

LongEmotion:衡量大语言模型在长上下文交互中的情感智能

计算与语言 2026-01-13 v2

摘要

大语言模型(LLM)在情感智能(EI)和长上下文建模方面取得了显著进展。然而,现有基准往往忽略了情感信息处理是作为一个连续的长上下文过程展开的这一事实。为了填补长上下文推理中多维 EI 评估的空白,并探索模型在更具挑战性条件下的性能,我们提出了 LongEmotion,这是一个包含一系列多样化任务的基准,旨在评估模型在情感识别、知识应用和共情生成方面的能力,其平均上下文长度为 15,341 个 token。为了在现实约束下提升性能,我们引入了协作情感建模(CoEM)框架,该框架整合了检索增强生成(RAG)和多智能体协作,以提升模型在长上下文场景中的 EI。我们对各种模型在长上下文设置下进行了详细分析,研究了推理模式激活、基于 RAG 的检索策略以及上下文长度适应性如何影响其 EI 性能。我们的项目页面为:https://longemotion.github.io/

关键词

引用

@article{arxiv.2509.07403,
  title  = {LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction},
  author = {Weichu Liu and Jing Xiong and Yuxuan Hu and Zixuan Li and Minghuan Tan and Ningning Mao and Hui Shen and Wendong Xu and Chaofan Tao and Min Yang and Chengming Li and Lingpeng Kong and Ngai Wong},
  journal= {arXiv preprint arXiv:2509.07403},
  year   = {2026}
}

备注

Technical Report