中文

利用大语言模型自动生成人格情境判断测试题项

计算与语言 2026-02-10 v4 人工智能

摘要

通过情境判断测试进行人格评估相比传统的李克特型自评量表具有独特优势,但其开发过程仍然劳动密集、耗时且严重依赖主题专家。大语言模型的最新进展已展现出自动题项生成的潜力。基于这些进展,本研究重点在于开发和评估一个结构化且可泛化的框架,用于自动生成人格 SJT,并以 GPT-4 和 ChatGPT-5 作为实证示例。我们进行了三项研究。研究 1 系统比较了提示设计和温度设置对 LLM 生成题项内容效度的影响,以开发一种有效且稳定的基于 LLM 的人格 SJT 自动题项生成方法。结果表明,优化的提示和 1.0 的温度在 GPT-4 上实现了创造力与准确性的最佳平衡。研究 2 通过多轮考察了这种自动化 SJT 生成方法的跨模型泛化性和可重复性。结果表明,该方法在 ChatGPT-5 上持续产生可重复且高质量的题项。研究 3 评估了涵盖大五人格特质五个维度的 LLM 生成 SJT 的心理测量特性。结果表明,大多数维度表现出令人满意的信度和效度,尽管在顺从性维度的收敛效度和某些效标关联效度方面观察到了局限性。这些发现提供了强有力的证据,表明所提出的基于 LLM 的自动题项生成方法能够产生具有文化适宜性且心理测量学上可靠的 SJT,其效率可与传统方法相当或超越传统方法。

关键词

引用

@article{arxiv.2412.12144,
  title  = {Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models},
  author = {Chang-Jin Li and Jiyuan Zhang and Yun Tang and Jian Li},
  journal= {arXiv preprint arXiv:2412.12144},
  year   = {2026}
}

备注

Accepted by Computers in Human Behavior Reports. The supplementary materials, data, and items are available at https://osf.io/jbvq7/