什么是抗议?在大语言模型时代的代码本体化仍是分类的首要关切
计算与语言
2025-10-07 v1
摘要
生成式大语言模型(LLM)如今已被广泛用于计算社会科学中的文本分类。在本工作中,我们关注LLM提示之前后的步骤——即概念的概念化以及使用LLM预测进行下游统计推断——我们认为这些步骤在大量LLM时代的计算社会科学研究中被忽视了。我们指出,LLM会使分析人员倾向于跳过概念化步骤,从而导致概念化错误,这些错误会偏导下游估计。通过仿真实验,我们展示,这种由概念化引起的偏差不能仅通过提高LLM的准确性或事后偏差纠正方法来纠正。我们通过提醒计算社会科学分析师,概念化在LLM时代仍是首要关切,并提供具体建议,以实现低成本、无偏、低方差的下游估计。
引用
@article{arxiv.2510.03541,
title = {What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification},
author = {Andrew Halterman and Katherine A. Keith},
journal= {arXiv preprint arXiv:2510.03541},
year = {2025}
}