硅质哲学家的异质性崩塌
计算机与社会
2026-04-30 v2 计算与语言
机器学习
摘要
硅质样本越来越被用作人类小组的低成本替代品,已被证明能够高保真地复现人类意见的聚合结果。我们展示在与对齐相关的哲学领域,硅质样本系统性地崩塌了异质性。使用来自 PhilPeople 插画的 N = {277} 专业哲学家数据,我们评估了七个专有和开源大型语言模型其复制单个哲学立场和保持跨哲学领域的跨问题相关结构能力。我们发现,语言模型在哲学判断上显著过度相关,产生人工共识,跨领域。这种崩塌部分与专家效应有关,即模型隐式假设领域专家持有高度相似的哲学观点。我们通过研究 DPO 微调的影响并用完整的 PhilPapers 2020 调查(N = {1785})进行验证来评估这些发现的鲁棒性。我们随后讨论了对齐、评估以及将硅质样本用作人类判断替代品的含义。本项目的代码可在 https://github.com/stanford-del/silicon-philosophers 查阅。
引用
@article{arxiv.2604.23575,
title = {The Collapse of Heterogeneity in Silicon Philosophers},
author = {Yuanming Shi and Andreas Haupt},
journal= {arXiv preprint arXiv:2604.23575},
year = {2026}
}