谁的人格?大语言模型研究中的合成人格实验及其透明度之路
计算机与社会
2025-12-02 v1 计算与语言
摘要
合成人格实验已成为大语言模型对齐研究中一种突出的方法,但这些人格的代表性和生态有效性在不同研究之间存在显著差异。通过对 2023 年至 2025 年在主要 NLP 和 AI 会议上发表的 63 篇同行评议研究进行综述,我们揭示了一个关键缺口:尽管人格化在本质上依赖于这些标准,但任务和感兴趣的人群往往未被充分阐述。我们的分析显示,用户代表性存在显著差异,大多数研究聚焦于有限的社会人口学属性,且仅有 35% 的研究讨论了其大语言模型人格的代表性。基于我们的发现,我们提出了一套人格透明度清单,强调代表性抽样、对经验数据的明确 grounding 以及增强的生态有效性。我们的工作提供了对当前实践的全面评估以及改善人格基准评估在语言模型对齐研究中严谨性和生态有效性的实用指南。
引用
@article{arxiv.2512.00461,
title = {Whose Personae? Synthetic Persona Experiments in LLM Research and Pathways to Transparency},
author = {Jan Batzner and Volker Stocker and Bingjun Tang and Anusha Natarajan and Qinhao Chen and Stefan Schmid and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2512.00461},
year = {2025}
}
备注
Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling