改善人类与机器代码之间的对齐:基于心理学中构造识别的提示工程实证评估
计算与语言
2025-12-04 v1
摘要
由于其架构和大规模预训练数据,大型语言模型(LLM)在文本分类任务中表现出强大的性能。然而,LLM的输出——即文本所属类别——高度依赖提示词的措辞。尽管提示工程文献在不断扩充,但鲜有研究聚焦于分类任务,更少有研究涉及心理学等领域,后者的构造具有精确且理论驱动的定义,可能在预训练数据中未得到充分代表。我们提出了一套用于通过提示工程优化LLM在文本中识别构造的实证框架。我们实验评估了五种提示策略——基于词典引导的经验提示选择、自动提示工程、角色扮演提示、链式思考推理和解释性提示——并进行零样本和少样本分类。我们发现,角色扮演、链式思考和解释性提示并未完全解决因提示词措辞不当而导致的性能下降。相反,提示词的最具影响力的特征是构造定义、任务框架化,以及稍弱的示例。对于三种构造和两种模型,与专家判断最吻合的分类结果来自结合词典引导的经验提示选择与自动提示工程的少样本提示。基于我们的发现,我们建议研究人员在可行的范围内生成和评估尽可能多的提示变体,无论是人工设计的、自动生成的,理想情况下两者兼顾,并根据训练数据集中的实际性能选择提示词和示例,在留存集中验证最终方法。该程序为在与专家判断对齐至关重要的场景下优化LLM提示词提供了一种实用、系统且理论驱动的方法。
引用
@article{arxiv.2512.03818,
title = {Improving Alignment Between Human and Machine Codes: An Empirical Assessment of Prompt Engineering for Construct Identification in Psychology},
author = {Kylie L. Anglin and Stephanie Milan and Brittney Hernandez and Claudia Ventura},
journal= {arXiv preprint arXiv:2512.03818},
year = {2025}
}
备注
22 pages, 2 figures