中文

自评测试并非衡量LLM人格的可靠手段

计算与语言 2024-01-04 v2 人工智能

摘要

随着大语言模型(LLM)能力的演进,近期多项研究试图使用为研究人类行为而创建的心理工具来量化其行为。其中一个例子是利用为衡量人类人格而开发的自我评估人格测试来测量LLM的“人格”。然而这些工作几乎都未验证此类测试在LLM上的适用性。本文通过两个简单实验分析了从自我评估人格测试获得的LLM人格分数的可靠性。我们首先引入提示敏感性这一属性,使用代表在LLM上实施自我评估测试的三种直观方式的三个语义等价提示来测量同一LLM的人格。我们发现所有三个提示均导致非常不同的人格分数,且在绝大多数场景中该差异对所有特质均具有统计显著性。随后我们引入LLM人格测量的选项顺序对称性属性。由于大多数自我评估测试以多项选择题(MCQ)形式存在,我们认为分数不仅应对提示模板鲁棒,也应对于选项呈现顺序鲁棒。该测试不出所料地揭示自我评估测试分数对选项顺序并不鲁棒。在ChatGPT与三种不同规模的Llama2模型上完成的这些简单测试表明,为人类创建的自评人格测试并非衡量LLM人格的可靠手段。

关键词

引用

@article{arxiv.2309.08163,
  title  = {Self-Assessment Tests are Unreliable Measures of LLM Personality},
  author = {Akshat Gupta and Xiaoyang Song and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2309.08163},
  year   = {2024}
}