中文

利用隐式情感:增强 LLM 心理特征评估中的可靠性与有效性

计算与语言 2025-03-27 v1 人工智能

摘要

最近的大型语言模型 (LLM) 进展导致其日益集成到人类生活中。随着从工具向类人助手的转变,理解它们的心理方面——例如情感倾向和性格——变得至关重要,以确保其可信度。然而,当前对 LLM 的心理评估常基于人类心理评估工具如 BFI,面临显著局限性。这些方法的结果在预测 LLM 在现实情境中的行为时,往往缺乏可靠性且有效性有限。在本工作中,我们提出了一种专为 LLM 设计的新型评估工具,称为核心情感清单 (CSI)。CSI 是一款双语工具,覆盖英文和中文,通过隐式评估模型的情感倾向,为 LLM 在乐观、悲观和中性三个维度上提供心理轮廓。通过大量实验,我们展示了:1) CSI 有效捕捉细微的情感模式,揭示了 LLM 在不同语言和情境中的显著差异;2) 与当前方法相比,CSI 在可靠性方面显著提高,产生更一致的结果;3) CSI 分数与 LLM 真实输出情感的相关性超过 0.85,证明了其在预测 LLM 行为方面的强大有效性。我们将将 CSI 公开发布于:https://github.com/dependentsign/CSI。

关键词

引用

@article{arxiv.2503.20182,
  title  = {Leveraging Implicit Sentiments: Enhancing Reliability and Validity in Psychological Trait Evaluation of LLMs},
  author = {Huanhuan Ma and Haisong Gong and Xiaoyuan Yi and Xing Xie and Dongkuan Xu},
  journal= {arXiv preprint arXiv:2503.20182},
  year   = {2025}
}

备注

Code available via https://github.com/dependentsign/CSI