中文

人性化 LLM:心理测量工具、数据集与人类-智能体应用的综述

计算机与社会 2025-05-02 v1 计算与语言 人机交互 机器学习

摘要

随着大型语言模型(LLM)在人类中心任务中日益广泛地应用,评估其心理特征对于理解其社会影响并确保可信赖的人工智能对齐至关重要。虽然已有一些综述涵盖了相关研究的某些方面,但包括对多样化心理测试的详细讨论、LLM 特定的心理数据集,以及 LLM 带有心理特征的应用等多个重要领域尚未系统地得到讨论。为填补这一空白,本文系统性地综述了将心理理论应用于 LLM 的六个关键维度:(1)评估工具;(2)LLM 特定数据集;(3)评估指标(一致性与稳定性);(4)实证发现;(5)人格模拟方法;(6)LLM 基于行为的仿真。我们的分析突出了当前方法的优势与局限性。虽然某些 LLM 在特定提示方案下表现出可重复的人格模式,但在不同任务和环境下的变异性仍然显著。鉴于心理工具与 LLM 能力之间的不匹配,以及评估实践中的不一致性等方法论挑战,本研究旨在为 developing 更具可解释性、稳健性和通用性的 LLM 心理评估框架的未来方向提出建议。

关键词

引用

@article{arxiv.2505.00049,
  title  = {Humanizing LLMs: A Survey of Psychological Measurements with Tools, Datasets, and Human-Agent Applications},
  author = {Wenhan Dong and Yuemeng Zhao and Zhen Sun and Yule Liu and Zifan Peng and Jingyi Zheng and Zongmin Zhang and Ziyi Zhang and Jun Wu and Ruiming Wang and Shengmin Xu and Xinyi Huang and Xinlei He},
  journal= {arXiv preprint arXiv:2505.00049},
  year   = {2025}
}

备注

26 pages,7 figures