为社会科学选择语言模型:从小规模起步、从开源起步并进行验证
计算与语言
2026-01-19 v1 人工智能
摘要
目前,社会科学家有数千个大型预训练语言模型(LLM)可用。我们如何在其中进行选择?以有效性、可靠性、可复现性和可重复性为指导,我们探讨了以下方面的重要性:(1) 模型开放性,(2) 模型足迹,(3) 训练数据,以及 (4) 模型架构和微调。虽然在这些讨论中通常优先考虑先验有效性测试(即基准测试),但我们认为社会科学家不能完全避免对计算测量进行事后验证。特别是,可重复性是选择语言模型的一个更迫切的指导标准。能够可靠地重复涉及使用语言模型的特定发现,需要可靠地重现一项任务。为此,我们建议从较小的开源模型开始,并构建明确的基准测试以证明整个计算流程的有效性。
引用
@article{arxiv.2601.10926,
title = {Selecting Language Models for Social Science: Start Small, Start Open, and Validate},
author = {Dustin S. Stoltz and Marshall A. Taylor and Sanuj Kumar},
journal= {arXiv preprint arXiv:2601.10926},
year = {2026}
}