大语言模型的性格测试:时间稳定性有限,但亲社会性突出
人工智能
2025-01-07 v3 计算与语言
人机交互
摘要
随着大语言模型(LLMs)因其类人特质及向用户提供的亲密感而持续流行,其社会影响不可避免地扩大。这导致亟需开展全面研究以充分理解 LLMs 并揭示其潜在机遇、缺陷及整体社会影响。鉴于此,本研究对七个 LLM 进行了广泛调查,旨在评估其在两个时间点上对性格量表作答的时间稳定性与评分者间一致性。此外,分析了 LLMs 的性格剖面并与人类常模数据进行比较。研究发现,在短期内 LLMs 作答的评分者间一致性水平不一,部分 LLM(如 LIama3 和 GPT-4o)较其他(如 GPT-4 和 Gemini)表现出更高的一致性。此外,一致性取决于所用量表以及领域或特质。这意味着 LLMs 可靠模拟稳定人格特征的能力具有可变的稳健性。对于至少显示尚可一致性的量表,LLMs 在能动与公共两个领域均主要呈现社会期望剖面,以及反映更高宜人性、尽责性与更低马基雅维利主义的亲社会人格剖面。由于社会影响与 AI 安全问题,在人格特质上展现时间稳定性与连贯回应对于 AI 系统至关重要。
引用
@article{arxiv.2306.04308,
title = {Personality testing of Large Language Models: Limited temporal stability, but highlighted prosociality},
author = {Bojana Bodroza and Bojana M. Dinic and Ljubisa Bojic},
journal= {arXiv preprint arXiv:2306.04308},
year = {2025}
}
备注
21 pages, 1 table