衡量有什么重要:基于情境判断测试的人类测量理论评估 AI
人工智能
2026-05-12 v2
摘要
人格条件化在引导大型语言模型 (LLM) 行为方面被广泛使用,但是否诱导稳定的行为结构或仅产生表面性变化尚不明确。我们提出了一个框架,通过情境判断测试 (SJT)、多维项目反应理论 (MIRT) 和结构化合成人格来衡量一致的行为倾向,将响应视为潜在行为变量的观测值。我们发现,人格条件化后的行为在不同运行之间保持稳定,潜在特征得分能预测外部基准(如 TruthfulQA、EmoBench),而 MIRT 揭示了一致的潜在结构。我们通过人类标注、基准评估和内部一致性分析验证了这些结果。我们将这些特征解释为在不同情境中表达的稳定行为倾向,而非人类人格。我们的结果表明,情境基于的人类测量理论评估为评估 LMM 行为提供了更可靠的替代方法,而我们发布的数据集支持进一步研究。
引用
@article{arxiv.2510.22170,
title = {Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests},
author = {Alexandra Yost and Shreyans Jain and Shivam Raval and Grant Corser and Allen Roush and Nina Xu and Jacqueline Hammack and Ravid Shwartz-Ziv and Amirali Abdullah},
journal= {arXiv preprint arXiv:2510.22170},
year = {2026}
}
备注
100 pages