中文

R.U.Psycho:语言模型鲁棒的统一心理测量测试

计算与语言 2025-03-14 v1

摘要

生成语言模型正越来越多地接受旨在用于人类测试的心理测量问卷,以建立其特征作为对齐的基准,或模拟社会科学实验中的参与者。虽然这一日益增长的研究成果揭示了模型响应与人类响应的相似性,但对这些实验可能进行的严谨性和可重复性存在担忧。模型输出的不稳定性、对提示设计、参数设置的敏感性以及大量可用模型版本增加了文档要求。因此,结果的泛化往往复杂且可重复性远无保证。在本文中,我们提出了R.U.Psycho,一个用于设计和运行生成语言模型上鲁棒且可重复的心理测量实验的框架,仅需要有限的编码专业知识。我们在一系列心理测量问卷上展示了该框架的能力,为文献中的先前发现提供了支持。R.U.Psycho以Python包的形式发布于https://github.com/julianschelb/rupsycho。

关键词

引用

@article{arxiv.2503.10229,
  title  = {R.U.Psycho? Robust Unified Psychometric Testing of Language Models},
  author = {Julian Schelb and Orr Borin and David Garcia and Andreas Spitz},
  journal= {arXiv preprint arXiv:2503.10229},
  year   = {2025}
}