中文

面向生成心理测量的提示工程规模开发

人工智能 2026-03-18 v1 计算与语言 人机交互

摘要

本蒙特卡洛模拟检验了提示工程策略如何塑造大型语言模型(LLM)在生成心理测量框架 AI-GENIE 中生成的人格评估项目质量。通过多种提示设计(零-shot、few-shot、基于角色人格化和自适应)、模型温度以及 LLM 类型生成针对大五人格的项目池,然后使用网络心理学方法进行评估和减少。在所有条件下,AI-GENIE 均可在减少后提高结构有效性,其增量贡献的大小与输入项目池质量呈反比。提示设计对项目质量在减缓前后均产生显著影响。自适应提示始终优于非自适应策略,通过显著降低语义冗余、提升减缓前的结构有效性并显著保留更大的项目池,尤其在搭配较新、更高容量的模型时效果更为明显。这些收益在大多数模型的温度设置下均为稳健的,表明自适应提示可减轻创造性与心理测量一致性之间的常见权衡。GPT-4o 模型在高温度下的异常情况表明,该模型在高随机性下的自适应约束具有模型特异性敏感性。总体而言,本研究表明自适应提示在此背景下是最强方法,且其优势随模型能力的提升而规模化,激励进一步探讨模型-提示在生成心理测量管道中的相互作用。

关键词

引用

@article{arxiv.2603.15909,
  title  = {Prompt Engineering for Scale Development in Generative Psychometrics},
  author = {Lara Lee Russell-Lasalandra and Hudson Golino},
  journal= {arXiv preprint arXiv:2603.15909},
  year   = {2026}
}

备注

22 pages, 7 figures