运用语言模型识别不可复制的社会科学研究
计算与语言
2025-03-17 v1
摘要
本研究探讨了大型语言模型(LLM)能否用于指示行为社会科学研究是否可复制。我们使用包含 14 项已复制研究(9 项成功,5 项不成功)的数据集,评估了开源模型(Llama 3 8B、Qwen 2 7B、Mistral 7B)和专有模型(GPT-4o)在区分可复制与不可复制发现方面的能力。我们使用 LLM 生成行为研究响应的合成样本,并估计所测量的效应是否支持原始发现。与人类复制结果进行比较后,我们以最高可达 的 F1 分数(Mistral 7B)、(GPT-4o 和 Llama 3 8B)以及 (Qwen 2 7B)的成绩,表明这些模型在此任务中的潜力。我们还分析了效应大小计算受采样温度影响的情况,发现低方差(由于温度)会导致偏差的效应估计。
引用
@article{arxiv.2503.10671,
title = {Identifying Non-Replicable Social Science Studies with Language Models},
author = {Denitsa Saynova and Kajsa Hansson and Bastiaan Bruinsma and Annika Fredén and Moa Johansson},
journal= {arXiv preprint arXiv:2503.10671},
year = {2025}
}