从潜变量视角观察 LLM 中的认知幻影
人工智能
2025-05-13 v1 人机交互
摘要
大语言模型(LLM)日益接近实际应用, necessitating 更深入地理解其行为。其规模和复杂性使传统评估方法变得复杂,催生了受心理学领域启发的替代方法。最近的研究通过对 LLM 进行心理测量问卷,报告了类似人类的特征,可能影响 LLM 的行为。然而,这种方法存在有效性问题:它预设了这些特征存在于 LLM 中,并且可以用为人类设计的工具进行测量。典型做法很少承认 LLM 中的有效性问题,比较和解释平均的 LLM 得分。本研究通过对比人类和三种 LLM 的人格潜在结构,使用两套经过验证的性格问卷来调查这一问题。研究发现,为人类设计的问卷并不validly 测量类似的 construct 在 LLM 中,此类 construct 甚至可能根本不存在于 LLM 中,这凸显了对 LLM 响应进行心理测量分析以避免追逐认知幻影的必要性。
引用
@article{arxiv.2409.15324,
title = {Cognitive phantoms in LLMs through the lens of latent variables},
author = {Sanne Peereboom and Inga Schwabe and Bennett Kleinberg},
journal= {arXiv preprint arXiv:2409.15324},
year = {2025}
}