在小规模人类样本上微调大语言模型是否增加异质性、对齐性和信念-行动一致性?
计算与语言
2025-12-30 v3
摘要
关于大语言模型 (Large Language Models, LLMs) 是否可作为调查和实验研究中人类参与者的替代品,正在展开激烈争论。虽然市场营销和心理学等领域的研究探索了LLM基于模拟的潜力,但日益增长的证据警示 caution:LLMs常常未能与真实人类行为一致,表现出有限的多样性、对少数族裔群体的系统性错位、不足的群内方差,以及信念与行动之间的差异。本研究检索一个重要且不同问题:在小规模人类调查数据(如来自小规模研究的样本)上进行微调,是否能缓解这些问题并产生真实的模拟结果。我们进行了一次关于信息披露的行为实验,比较了人类和LLM生成的响应在多个维度上的表现,包括分布式差异、族裔群体对齐、信念-行动一致性以及回归系数的恢复。我们发现,在小规模人类样本上进行微调在异质性、对齐性和信念-行动一致性方面显著优于基础模型。然而,即使是最佳表现的微调模型也未能复现原始研究的回归系数,表明LLM生成的数据仍不适合用于取代人类参与者进行正式推论分析。
引用
@article{arxiv.2511.21218,
title = {Can Finetuing LLMs on Small Human Samples Increase Heterogeneity, Alignment, and Belief-Action Coherence?},
author = {Steven Wang and Kyle Hunt and Shaojie Tang and Kenneth Joseph},
journal= {arXiv preprint arXiv:2511.21218},
year = {2025}
}