评估大语言模型之本质:一种反人类中心主义的警示
人工智能
2024-06-28 v3 计算与语言
计算机与社会
人机交互
摘要
随着 OpenAI 的聊天机器人 ChatGPT 的发布,生成式 AI 模型引发了公众的大量关注与猜测。至少存在两种观点阵营:一方对这些模型为人类任务带来根本性改变的可能性感到兴奋,另一方则高度担忧这些模型似乎拥有的能力。为解决这些担忧,我们使用标准化、常模化且经过验证的认知与人格测验评估了多个 LLM,主要是 GPT 3.5。在这个初步项目中,我们开发了一套测试组合,使我们能够估计其中部分模型能力的边界、这些能力在短时间内的稳定性,以及它们与人类的比较。我们的结果表明,LLM 不太可能已发展出感知觉,尽管其回应人格量表的能力颇为有趣。GPT3.5 在重复观测中确实在认知与人格测验上表现出较大变异性,而如果其具有类人的人格,这是不被预期的。尽管存在变异性,LLM 表现出在人类中会被视为心理健康状况不佳的特征,包括低自尊、明显与现实脱节,以及在某些情况下自恋与精神变态,尽管其回应显得乐观且有帮助。
引用
@article{arxiv.2309.07683,
title = {Assessing the nature of large language models: A caution against anthropocentrism},
author = {Ann Speed},
journal= {arXiv preprint arXiv:2309.07683},
year = {2024}
}
备注
31 pages, 6 figures