Codebook LLM:将 LLM 作为政治科学概念的测量工具进行评估
计算与语言
2026-04-01 v2
摘要
Codebook——用于操作化概念并概述标注程序的文件——在社会科学家编码政治文本时几乎被普遍采用。为了自动化这些文本的编码,研究者们日益倾向于使用生成式大型语言模型 (LLM)。然而,目前缺乏关于所谓的 LLM 在零样本情况下是否忠实地遵循现实世界的 codebook 操作化、以及是否以足够的准确性衡量复杂政治构念的实证证据。为此,我们收集并整理了三个真实世界的政治科学 codebook——涵盖抗议事件、政治暴力和政党纲领文件——并伴随其非结构化文本和人类标签。我们还提出了一个五阶段框架,用于 codebook-LLM 测量:为人类和 LLM 准备 codebook、测试 LLM 在 codebook 上的基本能力、评估零样本测量准确性(即即插即用性能)、分析错误并进一步进行(参数高效)监督训练 LLM。我们使用三个 codebook 数据集和多个预训练 7-120 亿参数的开源 LLM 对此框架进行实证演示。我们发现当前的开源 LLM 在零样本情况下遵循 codebook 存在局限性,但监督指令微调可以显著提高性能。我们的贡献不在于推荐“最佳” LLM,而在于我们提供的 codebook 数据集、评估框架以及为希望实施自身 codebook-LLM 测量项目的应用研究者提供指导。
引用
@article{arxiv.2407.10747,
title = {Codebook LLMs: Evaluating LLMs as Measurement Tools for Political Science Concepts},
author = {Andrew Halterman and Katherine A. Keith},
journal= {arXiv preprint arXiv:2407.10747},
year = {2026}
}
备注
Version 2 (v1 Presented at PolMeth 2024)