预训练语言模型中人格的评估与诱导
计算与语言
2023-10-31 v3 人工智能
机器学习
摘要
对机器行为的标准化和量化评估是理解LLM的关键。在本研究中,我们借鉴心理测量学研究的思路,利用人类人格理论作为研究机器行为的工具。人格研究起源于对人类行为的哲学探究,深入探讨个体在思维、情感和行为上的差异。在构建和理解类人社会机器的驱动下,我们旨在探究:我们能否以原则性和定量化的方式借助人类心理测量测试来评估机器行为?如果可以,我们能否在LLM中诱导出特定人格?为回答这些问题,我们引入了机器人格量表(MPI)工具来研究机器行为;MPI遵循标准化人格测试,建立在大五人格因素(Big Five)理论和人格评估量表之上。通过用MPI系统评估LLM,我们提供了首份证据,证明MPI在研究LLM行为方面的有效性。我们进一步设计了一种人格提示(P^2)方法,以可控方式在LLM中诱导特定人格,能够产生多样且可验证的行为。我们希望这项工作通过采用人格作为各类下游任务的基本指标,为未来研究提供启示,并进一步激发对同样引人入胜的类人机器行为的研究。
引用
@article{arxiv.2206.07550,
title = {Evaluating and Inducing Personality in Pre-trained Language Models},
author = {Guangyuan Jiang and Manjie Xu and Song-Chun Zhu and Wenjuan Han and Chi Zhang and Yixin Zhu},
journal= {arXiv preprint arXiv:2206.07550},
year = {2023}
}
备注
Accepted at NeurIPS 2023 (Spotlight)